Независимые эксперты и специалисты из разных IT-компаний расскажут об ML-решениях, которые повлияли на продукт и бизнес. А ещё традиционно на конференции будут крутые спикеры с keynotes, которых мы представим позже.
13:20-13:55
Доклад
От рекомендательного стека к одной генеративной модели в Яндекс Музыке
End-to-end одностадийные генеративные рекомендательные модели — перспективная активно развивающаяся область. Несколько компаний уже заявили об успешной реализации
этого подхода.
В своём докладе я расскажу, как нам удалось заменить весь стек рекомендательной системы Яндекс Музыки, состоящий
из множества кандидат-генераторов, нескольких этапов ранжирования, сотен признаков, в том числе нейросетевых (включая Argus), на end-to-end генеративную нейросеть
без ручного фича-инжиниринга.
Новая модель продемонстрировала значительный рост всех пользовательских метрик при полной замене старой системы. Поделюсь сложностями, с которыми мы столкнулись, расскажу,
как их удалось преодолеть. Покажу результаты офлайн-замеров
и онлайн-А/В-тестов.
Николай Савушкин
Яндекс R&D
Руководитель службы рекомендательных технологий
Закончил МГУ, последние четыре года занимается базовыми рекомендательными технологиями Яндекса. Увлекается бегом на длинные дистанции.
14:50-15:25
Доклад
Как мы развивали трансформерный item-энкодер в рекомендательной модели
Расскажу, как мы развивали item-энкодер в нашей модели: заменили DCN трансформерной архитектурой, стабилизировали обучение и оптимизировали производительность. Разберу проблемы, с которыми мы столкнулись при обучении и работе
с torch.compile, причины отказа от gradient clipping и реализацию собственного self-attention на Triton. Также поделюсь результатами архитектурных и оптимизационных экспериментов и покажу,
как новая модель проявила себя в A/B-тесте.
Дмитрий Веснин
Авито
Старший ML-разработчик
Окончил магистратуру Университета ИТМО. Работал младшим научным сотрудником
в СПб ФИЦ РАН, а затем ML-инженером в командах рекомендательных систем «Циана» и Ozon. Сейчас в «Авито» развивает рекомендательные модели на основе трансформеров.
15:30-16:05
Доклад
Agentic Vision: как научить VLM рассуждать и использовать инструменты
Современные VLM часто ошибаются в деталях, подсчёте объектов и пространственных отношениях. Один из способов повысить качество — дать модели возможность не отвечать сразу,
а построить план, получить дополнительную визуальную информацию, вызвать внешние инструменты и скорректировать решение по результатам промежуточных шагов.
В докладе разберём Agentic Vision VLM модели: планирование, visual reasoning, работу с регионами изображения, вызов OCR, детекторов, поиска и исполняемого кода. Обсудим, как обучать модель выбирать инструменты и выстраивать траекторию решения, а также как оценивать качество таких систем.
Данил Кашин
Яндекс R&D
Руководитель команды претрейна VLM
Руководит командой предобучения VLM в Яндексе.
До этого работал в Циане и VK. Окончил НИЯУ МИФИ, выступал приглашённым лектором в МИФИ, НИУ ВШЭ, МГТУ им. Н. Э. Баумана и онлайн-школе AI 360. Призёр двух хакатонов. Занимается компьютерным зрением, мультимодальными моделями
и развитием их способности рассуждать.
17:10-17:45
Доклад
Строим экономически эффективный инференс LLM для агентских (и не только) сценариев
Агентские сценарии заметно меняют профиль нагрузки на большие языковые модели. Контекст растёт от шага к шагу, значительная
его часть повторно используется, между обращениями одной сессии возникают паузы, а несколько агентов могут одновременно создавать резкие всплески нагрузки. В результате эффективность инференса определяется не только скоростью вычислений,
но и тем, где хранится KV-кеш, на какую реплику попадёт следующий запрос и как распределены ресурсы между prefill
и decode.
В докладе разберём особенности агентского трафика на основе нескольких публичных трасс, агентских бенчмарков и опыта эксплуатации моделей в Yandex AI Studio. Затем зададим SLO, запустим базовую конфигурацию на опенсорс-движке инференса
и посчитаем себестоимость обработки такого трафика.
После этого будем последовательно снижать стоимость инференса с помощью выбора подходящей схемы параллелизма, KV-aware-маршрутизации, спекулятивного декодирования, разделения prefill и decode и многоуровневого распределённого KV-кеша.
Для каждой техники рассмотрим, какие особенности нагрузки требуют её применения, разберём принцип её работы, готовность опенсорсных реализаций и эффект в реальной системе.
На примерах из эксплуатации DeepSeek-V3.2, DeepSeek-V4-Flash
и других больших моделей покажем, почему современный инференс — это не только модельный движок, но и сложная распределённая система. Также разберём несколько нетривиальных ошибок на границах её компонентов, с которыми мы сталкивались.
Владислав Носивской
Yandex Cloud
Руководитель группы инференса LLM
в Yandex AI Studio
Занимается запуском, эксплуатацией и оптимизацией больших языковых моделей. Начал карьеру в Яндексе
со стажировки, посвящённой исследованию сдвигов распределения в нейронных сетях. Развивает опенсорс-инструменты для LLM-инференса и является коллаборатором проекта Mooncake.
13:20-13:55
Доклад
Пока вы говорите: как устроен стриминговый перевод речи
Потоковый перевод вы слышите в реальном времени, не дожидаясь завершения всей речи говорящего. Расскажу, как мы сделали такую систему для перевода с английского на русский: как учили потоковый ASR и переводную LLM, какие архитектуры сравнивали, почему в итоге остановились на выбранной и почему выдача
по предложениям.
Отдельно разберём главный компромисс любой стриминговой системы — задержку против качества. Откуда она берётся
на каждом этапе пайплайна, как мы её измеряли и что помогло
её сократить, не потеряв в метриках. Покажу, как мы сегментировали поток на предложения и что делали
с нестабильностью гипотез на границах. И, конечно, поделюсь граблями, которые собрали по дороге.
Вилиана Девбунова
Яндекс R&D
Research ML Engineer в команде ASR
Четыре года в Яндексе занимается речевыми технологиями: делала нейронный синтез для немецкого и арабского, синтез на self-supervised-токенизации речи. Недавно закончила работу
над потоковым переводом речи en-ru. Сейчас учит Audio Language Model контекстному распознаванию и работает
над инклюзивным ASR — распознаванием речи людей
с речевыми нарушениями. Параллельно исследует управляемость
и механистическую интерпретируемость больших языковых моделей: работа
про evaluation awareness вышла
на воркшопе ICBINB на ICLR 2026. Ездит на спортивном мотоцикле
и убеждена, что это тоже задача про минимизацию задержки.
14:50-15:25
Доклад
RL meets Browser: как мы обучили VLM-агента работать в вебе за пользователя
Computer-Use-агенты — модели, которые сами выполняют действия в компьютерной среде вместо пользователя, — постепенно перестают быть демо и становятся рабочей технологией. Но путь от «у нас есть VLM» до «агент выполняет задачи пользователя в проде» гораздо длиннее, чем кажется: живой браузер не детерминирован, эпизоды длинные, а рецептов multi-turn RL для мультимодальных агентов почти нет в открытом доступе.
Расскажу, как мы построили и обучили VLM-агента, который выполняет задачи в реальном браузере: начинали с booking-сценария, сейчас масштабируемся до широкого спектра пользовательских задач. Разберём архитектуру пайплайна
и объясним, почему одной VLM недостаточно. Покажу, как мы завели RL в сетапе, где агент действует в настоящем браузере:
как проектировали награды для длинных цепочек решений
на основе скриншотов и что потребовалось, чтобы обучение стало стабильным. Отдельно поговорим про инфраструктуру —
как встроить браузер в RL-пайплайн, добавить мультимодальность в тренировочный фреймворк, какие велосипеды пришлось построить, а какие выбросить — и про полуавтоматическую генерацию окружений, которая позволяет масштабировать среды, не утонув в ручной разметке.
Не обойду и грабли: что пошло не так, какие решения оказались контринтуитивными и что мы сделали бы иначе.
Артемий Голиков
Яндекс Алиса и Умные устройства
Руководитель бригады визуальных агентов в Алисе
Закончил ВМК МГУ. Более пяти лет занимается NLP. Сейчас
в Яндексе руководит командой визуальных агентов в Алисе, учит Алису работать в Браузере.
До этого занимался созданием арабского ассистента в Яндексе; начинал с работы в VK и Сбере. Любит чинить сломанные модельные тренировки, кататься на горных лыжах
и путешествовать.
15:30-16:05
Доклад
Диффузионный драфтинг в спекулятивном декодинге: DFlash и DSpark — от модели
до вывода в продакшн
Диффузионные драфтеры — новое направление в спекулятивном декодировании, где блок кандидатов генерируется преимущественно параллельно, а не токен за токеном. Кратко рассмотрю развитие подходов к многотокенному предсказанию
и разберу, как идеи параллельного драфтинга реализованы
в DFlash и получили дальнейшее развитие в DSpark.
Основное внимание уделю архитектурным инновациям в этих методах: non-causal drafting в DFlash, восстановлению зависимостей между токенами с помощью Markov head в DSpark,
а также использованию confidence head для динамического выбора длины верификации.
Отдельно расскажу о практической интеграции таких моделей
в inference-системы. На примере реализации в vLLM и vLLM-Ascend рассмотрю работу со статическими формами тензоров, CUDA
и ACL Graph, буферами, padding, batch descriptors и различиями между draft и target проходами. Также расскажу о типичных ошибках, ограничениях аппаратных платформ и компромиссах между качеством драфта (acceptance rate), стоимостью верификации и итоговым ускорением генерации.
Доклад будет полезен исследователям и ML-инженерам, которые занимаются ускорением инференса больших языковых моделей, speculative decoding и интеграцией новых архитектур
в высокопроизводительные inference-фреймворки.
Станислав Илюшин
Huawei
Старший инженер
Закончил ФКН НИУ ВШЭ.
Со второго курса бакалавриата работал в Ростелекоме над классическим NLP, а во время учёбы в магистратуре перешёл
в Сбер, где занимался дообучением LLM. После окончания магистратуры перешёл в Huawei, где сейчас занимается ускорением инференса, пишет статьи и контрибьютит в опенсорс. Среди профессиональных интересов — методы оптимизации, среди непрофессиональных
или житейских — Counter Strike
и рестораны.
14:50-15:25
Доклад
Дальше, точнее, быстрее: query-based-детекция для автономного транспорта
Система восприятия автономного автомобиля должна одновременно видеть далеко, детектировать точно и укладываться в жёсткий бюджет времени на edge-устройстве. Наша CNN-based-архитектура на базе BEVFusion даёт обзор на 250 м вперёд и назад и на 100 м по бокам, но масштабировать дальность не получается: любое расширение зоны видимости упирается либо в качество детекции, либо в скорость инференса.
Расскажу, как мы перешли на query-based-модель MV2DFusion
и сняли это ограничение: боковой обзор уже вырос с 100 до 200 м,
а дальность вперёд и назад архитектура позволяет увеличить с 250 до 400 м: это наши следующие планы. Разберём, почему выбрали именно эту модель и как сравнивали с BEVFusion по дальности, точности, скорости и потреблению ресурсов.
Основная часть доклада — про архитектуру: как устроена query-based-модель и что происходит с её компонентами при переезде. Покажу, как адаптируются разные головы и модули детектора,
как всё это работает с мультимодальными данными автономного автомобиля и какие особенности возникают при обучении. Отдельно сравню инференс до и после — по каждому компоненту
и по модели в целом в процентах.
Разберу готовый кейс оптимизации ML-модели с конкретными цифрами и решение классической дилеммы разработки:
как расширить охват данных (дальность обзора), сохранить качество и при этом стать быстрее.
Иван Лунев
Яндекс Автономный транспорт и роботы
Руководитель команды ядра детекции службы восприятия сцены, ведущий разработчик
Отвечает за функциональность детектора в автономном автомобиле: команда добавляет
в модель новые головы под задачи автономного транспорта, улучшает качество детекций
и развивает архитектуру. Выпускник матмеха СПбГУ и ШАД. До Яндекса занимался ADAS. Помогает с преподаванием алгоритмов и машинного обучения в ШАД, читает лекции
об автономном транспорте в вузах
и студкемпах.
Они лежат в основе всех наших продуктов: Поиска с Алисой, Браузера, Карт, Рекламных технологий, Алисы AI и умных устройств, Погоды, Шедеврума, Переводчика и других.
Мы обучаем LLM и мультимодальные модели на всех этапах — от претрейна до RL и SFT. Для повышения эффективности используем собственные библиотеки YaFSDP и YCCL. Работаем с кластерами на тысячи GPU и модифицируем инференс инфраструктуры, чтобы проверять гипотезы и свободно работать с моделями размером до 0,7 трлн параметров.
Внедрили семейство генеративных моделей Alice AI в более чем 25 продуктов Яндекса. Создали и развиваем Yambda — один из крупнейших в мире открытый рекомендательный датасет. Разработали библиотеку машинного обучения CatBoost — единственную из России, ставшую мировым научным стандартом.
Отвечаем за роботакси, роботов-доставщиков, роботраки и складских роботов. Наши продукты работают на ИИ-платформе собственной разработки.
Роботакси уже возит пассажиров в Москве, Иннополисе и Сириусе. Роботы доставляют заказы в десяти городах России и уже совершили больше миллиона доставок. Роботраки работают на М-4, М-11 и ЦКАД. Общий пробег флота — более 37 млн километров.
В нашу экосистему входят Кинопоиск, Яндекс Музыка, Яндекс Книги, Яндекс Плюс, Яндекс Пэй, Афиша, Едадил, Свои Плюсы и другие сервисы. Лояльная аудитория — более 48 млн человек, из которых 11,6 млн пользуются сервисами сразу из нескольких направлений: развлечений, финансов и программы лояльности.
Мы решаем сложную техническую задачу: с помощью данных и ML учимся точнее понимать вкусы, настроение и потребности каждого пользователя. Обучаем рекомендательные системы на архитектурах Argus и target-aware, разрабатываем LLM-агентов и инструменты персонализации. В Музыке запустили query2vibe и ИИ-компаньона Люмена, в Книгах — Recap и ИИ-помощника. В финансовых продуктах с полным циклом на собственной MLOps-платформе работаем над кредитным скорингом, управлением рисками и маркетинговыми моделями.
Наши технологии ежедневно влияют на опыт миллионов людей, делая каждое взаимодействие с сервисами точнее, персональнее и удобнее.
Мы отвечаем за Яндекс Go, Еду, Лавку, Доставку и Техплатформу. Разрабатываем все сервисы с упором на продуктовый подход, чтобы пользователям было удобно, а бизнесу — эффективно.
В месяц у наших продуктов более 60 млн уникальных пользователей в более чем 1000 городах.
Отвечаем за Яндекс Недвижимость, Аренду и Путешествия. Помогаем найти новый дом, арендовать квартиру, забронировать отель и купить билеты в путешествие.
Чтобы Вертикали показывали лучшие реальные предложения, обучаем новые модели для ранжирования, изобретаем кандидатогенераторы для рекомендаций, улучшаем Multi-View-Stereo-алгоритмы, занимаемся антифродом и модерацией контента.
Уже помогли организовать комфортное путешествие 28 млн пользователей. Создали классифайд, где ежедневно представлено более 2 млн объектов недвижимости. Организовали Аренду так, чтобы пользователи могли выбрать объект и оформить документы полностью онлайн — так 95% квартир в столичных регионах сдавались дистанционно после просмотра 3D-тура.
Платформа объединяет более 75 сервисов, которые включают решения для кибербезопасности, управления данными, разработки и внедрения ИИ.
Наши решения напрямую влияют на качество Алисы AI, точность Поиска, удобство Карт и Яндекс Путешествий для миллионов людей.
С нуля развиваем собственные краудсорсинговые платформы — сложнейшие системы управления распределённой командой, в которой работают свыше 100 тыс. исполнителей разных специальностей.
Занимался ML в Lamoda, Mail.ru и HeadHunter, а ещё преподавал в НИУ ВШЭ и МГТУ им. Баумана. Был одним из создателей сообщества ODS. Сейчас развивает бренд машинного обучения Яндекса и помогает делать конференции — например, HighLoad++, PyCon, DUMP и Data Fest.
В Яндексе больше 10 лет: пришёл стажёром, дорос до руководителя службы распознавания речи, затем два года управлял отделом NLP, а летом 2025-го стал CTO R&D. Преподавал в ШАД алгоритмы и машинное обучение. Живёт и работает в Минске.
Ex-Staff Machine Learning Engineer в eBay. Строил компьютерное зрение с нуля в PlanetFarms и работал исследователем в Toloka.ai. Преподаватель машинного обучения ФКН ВШЭ и Deep Learning School. Автор телеграм-канала «Борис опять» .
Больше 10 лет в области AI — успел поработать в Яндексе, VK и Huawei. Защитил диссертацию по анализу текстов и сейчас является доцентом в Высшей школе цифровой культуры ИТМО. Сейчас является руководителем лаборатории в ИСП РАН. Автор телеграм-канала «Valuable AI / Валентин Малых» .
Занимается машинным обучением с 2010 года. Защитил кандидатскую диссертацию в 2013 году, пишет докторскую диссертацию про применение мультимодальных архитектур для задач обеспечения пассивной безопасности мультимедийного контента. Руководит лабораторией мультимодального генеративного ИИ FusionBrain в Институте искусственного интеллекта AIRI. Один из основателей семейства моделей Kandinsky, преподаёт в Самарском университете и ИТМО, выступает с лекциями и пишет о событиях в AI и ML в телеграм-канале «Complete AI» . Автор более 150 научных публикаций, в том числе в топ-журналах (Q1/Q2) и сборниках конференций Core A/A*. Индекс Хирша — 20.
В составе команды AI Marvel трансформирует бизнес-направления Яндекса, внедряя AI- и ML-решения в ключевые процессы компании. Ранее отвечала за исследования новых методов ИБ в команде безопасности Городских сервисов, до 2024 года возглавляла направление машинного обучения в Positive Technologies.