Инференс LLM превратился в отдельную инженерную дисциплину. Мы поговорим о том, как заставить LLM работать быстро, дешево и разных девайсах.
Data Fest 2026LLM inference
Что собрали в секции:
Алгоритмическая оптимизация — Квантизация: что реально работает в проде, а что только на бумаге: Speculative decoding, Medusa, Eagle и другие техники ускорения декодирования.
Serving-инфраструктура — Continuous batching, PagedAttention, KV-cache eviction: как устроены современные движки (vLLM, TensorRT-LLM, SGLang). Планирование запросов и управление памятью под нагрузкой — Prefill/decode disaggregation.
Distributed inference, MoE inference.
Железо и девайсы — CPU vs GPU vs NPU vs специализированные чипы, инференс наLLM на телефоне, планшете, embedded-устройствах.
Архитектурная специфика — MoE-модели: особенности инференса, expert routing, нагрузка на interconnect. Long-context инференс: memory и latency при 128k+ токенах — Multimodal inference.
Инновации в инференсе: мостик между исследованиями и реальным применением — Разбираем, как превратить свежие статьи с ArXiv в стабильный профит на проде. Обсудим, какие техники (Speculative decoding, Medusa, Eagle) действительно ускоряют генерацию, а какие остаются лабораторными артефактами. Погрузимся в "кишки" современных движков (vLLM, TensorRT-LLM), изучим специфику MoE и Long-context на 128k+ токенов, а также сравним железо: от серверных H100 до NPU в вашем смартфоне.
Our website uses cookies, including web analytics services. By using the website, you consent to the processing of personal data using cookies. You can find out more about the processing of personal data in the Privacy policy