Machine Learning, проверенный практикой
|

19_09_26

в Москве и онлайн
Зарегистрироваться

Хардовая конференция для экспертов и практиков. Здесь будет всё о практическом применении ML: технические доклады ведущих специалистов отрасли, инженерные дискуссии и много нетворкинга.

Обсудим, как извлечь из машинного обучения реальную пользу для бизнеса.

Data Science NLP RecSys CV Speech MLOps Data Science NLP RecSys CV Speech MLOps Data Science NLP RecSys CV Speech MLOps Data Science NLP RecSys CV Speech MLOps Data Science NLP RecSys CV Speech MLOps Data Science NLP RecSys CV Speech MLOps
Что вас ждёт?
Доклады

Независимые эксперты и специалисты из разных IT-компаний расскажут об ML-решениях, которые повлияли на продукт и бизнес. А ещё традиционно на конференции будут крутые спикеры с keynotes, которых мы представим позже.

Докладчики выступят в трёх офлайн-залах, «Данные», «Серверная» и «Код», а также в онлайн-зале «Сеть». Все доклады, кроме зала «Серверная», мы будем транслировать в прямом эфире.

Дискуссии
Наши эксперты выберут несколько тем и разберут их с разных сторон. Присоединяйтесь к дискуссиям: спорьте или дополняйте спикеров, предлагайте примеры из своей практики, стройте версии. Вот так, в диалоге, мы сформируем ключевые вызовы, подходы и тренды в ML.
Знакомство с сервисами Яндекса
О своих ML-решениях и продуктах расскажут Поисковые сервисы и ИИ, Вертикали, Персональные и Городские сервисы, Автономный транспорт, Yandex Cloud и Yandex Crowd. Знакомьтесь с представителями сервисов, участвуйте в активностях и выигрывайте классные призы.
Впервые у нас — награждение Yandex ML Prize
В зале «Серверная» проведём церемонию вручения Yandex ML Prize — премии Яндекса при экспертной поддержке ШАДа за вклад в развитие ML. В этом году отметим преподавателей, которые растят новые поколения хардовых специалистов.
Познакомим вас с теми, кто развивает научную часть ML, пока мы занимаемся его практической стороной. Кстати, до награждения можно будет пообщаться с преподавателями и узнать больше про их исследования.
Зал «Серверная»
17:00
Нетворкинг с номинантами премии — с некоторыми из них вы сможете познакомиться только тут
17:30
Дискуссия «Обучение ML в эпоху ИИ: как и насколько сильно нейросети изменят высшее образование и работу инженеров»

Программа конференции — in progress

13:20-13:55

Доклад

От рекомендательного стека к одной генеративной модели в Яндекс Музыке

End-to-end одностадийные генеративные рекомендательные модели — перспективная активно развивающаяся область. Несколько компаний уже заявили об успешной реализации
этого подхода.

В своём докладе я расскажу, как нам удалось заменить весь стек рекомендательной системы Яндекс Музыки, состоящий
из множества кандидат-генераторов, нескольких этапов ранжирования, сотен признаков, в том числе нейросетевых (включая Argus), на end-to-end генеративную нейросеть
без ручного фича-инжиниринга.

Новая модель продемонстрировала значительный рост всех пользовательских метрик при полной замене старой системы. Поделюсь сложностями, с которыми мы столкнулись, расскажу,
как их удалось преодолеть. Покажу результаты офлайн-замеров
и онлайн-А/В-тестов.

фото
RecSys

Николай Савушкин

Яндекс R&D

Руководитель службы рекомендательных технологий

 


Закончил МГУ, последние четыре года занимается базовыми рекомендательными технологиями Яндекса. Увлекается бегом на длинные дистанции.

14:50-15:25

Доклад

Как мы развивали трансформерный item-энкодер в рекомендательной модели

Расскажу, как мы развивали item-энкодер в нашей модели: заменили DCN трансформерной архитектурой, стабилизировали обучение и оптимизировали производительность. Разберу проблемы, с которыми мы столкнулись при обучении и работе
с torch.compile, причины отказа от gradient clipping и реализацию собственного self-attention на Triton. Также поделюсь результатами архитектурных и оптимизационных экспериментов и покажу,
как новая модель проявила себя в A/B-тесте.

фото
Data Science, RecSys

Дмитрий Веснин

Авито

Старший ML-разработчик

 


Окончил магистратуру Университета ИТМО. Работал младшим научным сотрудником
в СПб ФИЦ РАН, а затем ML-инженером в командах рекомендательных систем «Циана» и Ozon. Сейчас в «Авито» развивает рекомендательные модели на основе трансформеров.

15:30-16:05

Доклад

Agentic Vision: как научить VLM рассуждать и использовать инструменты

Современные VLM часто ошибаются в деталях, подсчёте объектов и пространственных отношениях. Один из способов повысить качество — дать модели возможность не отвечать сразу,
а построить план, получить дополнительную визуальную информацию, вызвать внешние инструменты и скорректировать решение по результатам промежуточных шагов.

В докладе разберём Agentic Vision VLM модели: планирование, visual reasoning, работу с регионами изображения, вызов OCR, детекторов, поиска и исполняемого кода. Обсудим, как обучать модель выбирать инструменты и выстраивать траекторию решения, а также как оценивать качество таких систем.

фото
CV, NLP

Данил Кашин

Яндекс R&D

Руководитель команды претрейна VLM

 


Руководит командой предобучения VLM в Яндексе.
До этого работал в Циане и VK. Окончил НИЯУ МИФИ, выступал приглашённым лектором в МИФИ, НИУ ВШЭ, МГТУ им. Н. Э. Баумана и онлайн-школе AI 360. Призёр двух хакатонов. Занимается компьютерным зрением, мультимодальными моделями
и развитием их способности рассуждать.

17:10-17:45

Доклад

Строим экономически эффективный инференс LLM для агентских (и не только) сценариев

Агентские сценарии заметно меняют профиль нагрузки на большие языковые модели. Контекст растёт от шага к шагу, значительная
его часть повторно используется, между обращениями одной сессии возникают паузы, а несколько агентов могут одновременно создавать резкие всплески нагрузки. В результате эффективность инференса определяется не только скоростью вычислений,
но и тем, где хранится KV-кеш, на какую реплику попадёт следующий запрос и как распределены ресурсы между prefill
и decode.

В докладе разберём особенности агентского трафика на основе нескольких публичных трасс, агентских бенчмарков и опыта эксплуатации моделей в Yandex AI Studio. Затем зададим SLO, запустим базовую конфигурацию на опенсорс-движке инференса
и посчитаем себестоимость обработки такого трафика.

После этого будем последовательно снижать стоимость инференса с помощью выбора подходящей схемы параллелизма, KV-aware-маршрутизации, спекулятивного декодирования, разделения prefill и decode и многоуровневого распределённого KV-кеша.
Для каждой техники рассмотрим, какие особенности нагрузки требуют её применения, разберём принцип её работы, готовность опенсорсных реализаций и эффект в реальной системе.

На примерах из эксплуатации DeepSeek-V3.2, DeepSeek-V4-Flash
и других больших моделей покажем, почему современный инференс — это не только модельный движок, но и сложная распределённая система. Также разберём несколько нетривиальных ошибок на границах её компонентов, с которыми мы сталкивались.

фото
MLOps

Владислав Носивской

Yandex Cloud

Руководитель группы инференса LLM
в Yandex AI Studio

 


Занимается запуском, эксплуатацией и оптимизацией больших языковых моделей. Начал карьеру в Яндексе
со стажировки, посвящённой исследованию сдвигов распределения в нейронных сетях. Развивает опенсорс-инструменты для LLM-инференса и является коллаборатором проекта Mooncake.

13:20-13:55

Доклад

Пока вы говорите: как устроен стриминговый перевод речи

Потоковый перевод вы слышите в реальном времени, не дожидаясь завершения всей речи говорящего. Расскажу, как мы сделали такую систему для перевода с английского на русский: как учили потоковый ASR и переводную LLM, какие архитектуры сравнивали, почему в итоге остановились на выбранной и почему выдача
по предложениям.

Отдельно разберём главный компромисс любой стриминговой системы — задержку против качества. Откуда она берётся
на каждом этапе пайплайна, как мы её измеряли и что помогло
её сократить, не потеряв в метриках. Покажу, как мы сегментировали поток на предложения и что делали
с нестабильностью гипотез на границах. И, конечно, поделюсь граблями, которые собрали по дороге.

фото
Speech, NLP

Вилиана Девбунова

Яндекс R&D

Research ML Engineer в команде ASR

 


Четыре года в Яндексе занимается речевыми технологиями: делала нейронный синтез для немецкого и арабского, синтез на self-supervised-токенизации речи. Недавно закончила работу
над потоковым переводом речи en-ru. Сейчас учит Audio Language Model контекстному распознаванию и работает
над инклюзивным ASR — распознаванием речи людей
с речевыми нарушениями. Параллельно исследует управляемость
и механистическую интерпретируемость больших языковых моделей: работа
про evaluation awareness вышла
на воркшопе ICBINB на ICLR 2026. Ездит на спортивном мотоцикле
и убеждена, что это тоже задача про минимизацию задержки.

14:50-15:25

Доклад

RL meets Browser: как мы обучили VLM-агента работать в вебе за пользователя

Computer-Use-агенты — модели, которые сами выполняют действия в компьютерной среде вместо пользователя, — постепенно перестают быть демо и становятся рабочей технологией. Но путь от «у нас есть VLM» до «агент выполняет задачи пользователя в проде» гораздо длиннее, чем кажется: живой браузер не детерминирован, эпизоды длинные, а рецептов multi-turn RL для мультимодальных агентов почти нет в открытом доступе.

Расскажу, как мы построили и обучили VLM-агента, который выполняет задачи в реальном браузере: начинали с booking-сценария, сейчас масштабируемся до широкого спектра пользовательских задач. Разберём архитектуру пайплайна
и объясним, почему одной VLM недостаточно. Покажу, как мы завели RL в сетапе, где агент действует в настоящем браузере:
как проектировали награды для длинных цепочек решений
на основе скриншотов и что потребовалось, чтобы обучение стало стабильным. Отдельно поговорим про инфраструктуру —
как встроить браузер в RL-пайплайн, добавить мультимодальность в тренировочный фреймворк, какие велосипеды пришлось построить, а какие выбросить — и про полуавтоматическую генерацию окружений, которая позволяет масштабировать среды, не утонув в ручной разметке.

Не обойду и грабли: что пошло не так, какие решения оказались контринтуитивными и что мы сделали бы иначе.

фото
NLP

Артемий Голиков

Яндекс Алиса и Умные устройства

Руководитель бригады визуальных агентов в Алисе

 


Закончил ВМК МГУ. Более пяти лет занимается NLP. Сейчас
в Яндексе руководит командой визуальных агентов в Алисе, учит Алису работать в Браузере.
До этого занимался созданием арабского ассистента в Яндексе; начинал с работы в VK и Сбере. Любит чинить сломанные модельные тренировки, кататься на горных лыжах
и путешествовать.

15:30-16:05

Доклад

Диффузионный драфтинг в спекулятивном декодинге: DFlash и DSpark — от модели
до вывода в продакшн

Диффузионные драфтеры — новое направление в спекулятивном декодировании, где блок кандидатов генерируется преимущественно параллельно, а не токен за токеном. Кратко рассмотрю развитие подходов к многотокенному предсказанию
и разберу, как идеи параллельного драфтинга реализованы
в DFlash и получили дальнейшее развитие в DSpark.

Основное внимание уделю архитектурным инновациям в этих методах: non-causal drafting в DFlash, восстановлению зависимостей между токенами с помощью Markov head в DSpark,
а также использованию confidence head для динамического выбора длины верификации.

Отдельно расскажу о практической интеграции таких моделей
в inference-системы. На примере реализации в vLLM и vLLM-Ascend рассмотрю работу со статическими формами тензоров, CUDA
и ACL Graph, буферами, padding, batch descriptors и различиями между draft и target проходами. Также расскажу о типичных ошибках, ограничениях аппаратных платформ и компромиссах между качеством драфта (acceptance rate), стоимостью верификации и итоговым ускорением генерации.

Доклад будет полезен исследователям и ML-инженерам, которые занимаются ускорением инференса больших языковых моделей, speculative decoding и интеграцией новых архитектур
в высокопроизводительные inference-фреймворки.

фото
NLP

Станислав Илюшин

Huawei

Старший инженер

 


Закончил ФКН НИУ ВШЭ.
Со второго курса бакалавриата работал в Ростелекоме над классическим NLP, а во время учёбы в магистратуре перешёл
в Сбер, где занимался дообучением LLM. После окончания магистратуры перешёл в Huawei, где сейчас занимается ускорением инференса, пишет статьи и контрибьютит в опенсорс. Среди профессиональных интересов — методы оптимизации, среди непрофессиональных
или житейских — Counter Strike
и рестораны.

Программа трека скоро появится — следите за обновлениями.

14:50-15:25

Доклад

Дальше, точнее, быстрее: query-based-детекция для автономного транспорта

Система восприятия автономного автомобиля должна одновременно видеть далеко, детектировать точно и укладываться в жёсткий бюджет времени на edge-устройстве. Наша CNN-based-архитектура на базе BEVFusion даёт обзор на 250 м вперёд и назад и на 100 м по бокам, но масштабировать дальность не получается: любое расширение зоны видимости упирается либо в качество детекции, либо в скорость инференса.

Расскажу, как мы перешли на query-based-модель MV2DFusion
и сняли это ограничение: боковой обзор уже вырос с 100 до 200 м,
а дальность вперёд и назад архитектура позволяет увеличить с 250 до 400 м: это наши следующие планы. Разберём, почему выбрали именно эту модель и как сравнивали с BEVFusion по дальности, точности, скорости и потреблению ресурсов.

Основная часть доклада — про архитектуру: как устроена query-based-модель и что происходит с её компонентами при переезде. Покажу, как адаптируются разные головы и модули детектора,
как всё это работает с мультимодальными данными автономного автомобиля и какие особенности возникают при обучении. Отдельно сравню инференс до и после — по каждому компоненту
и по модели в целом в процентах.

Разберу готовый кейс оптимизации ML-модели с конкретными цифрами и решение классической дилеммы разработки:
как расширить охват данных (дальность обзора), сохранить качество и при этом стать быстрее.

фото
CV

Иван Лунев

Яндекс Автономный транспорт и роботы

Руководитель команды ядра детекции службы восприятия сцены, ведущий разработчик

 


Отвечает за функциональность детектора в автономном автомобиле: команда добавляет
в модель новые головы под задачи автономного транспорта, улучшает качество детекций
и развивает архитектуру. Выпускник матмеха СПбГУ и ШАД. До Яндекса занимался ADAS. Помогает с преподаванием алгоритмов и машинного обучения в ШАД, читает лекции
об автономном транспорте в вузах
и студкемпах.

*Запись выступления будет доступна для участников после конференции
Смотреть всю программу
Знакомство с сервисами Яндекса

Программный комитет

Руководитель программного комитета
Петр Ермаков
Яндекс R&D
ML Бренд-директор

Занимался ML в Lamoda, Mail.ru и HeadHunter, а ещё преподавал в НИУ ВШЭ и МГТУ им. Баумана. Был одним из создателей сообщества ODS. Сейчас развивает бренд машинного обучения Яндекса и помогает делать конференции — например, HighLoad++, PyCon, DUMP и Data Fest.

NLP
Алексей Колесов
Яндекс R&D
СTO

В Яндексе больше 10 лет: пришёл стажёром, дорос до руководителя службы распознавания речи, затем два года управлял отделом NLP, а летом 2025-го стал CTO R&D. Преподавал в ШАД алгоритмы и машинное обучение. Живёт и работает в Минске.

Data Science
Борис Цейтлин
Plata
Principal AI/ML Engineer

Ex-Staff Machine Learning Engineer в eBay. Строил компьютерное зрение с нуля в PlanetFarms и работал исследователем в Toloka.ai. Преподаватель машинного обучения ФКН ВШЭ и Deep Learning School. Автор телеграм-канала «Борис опять» .

NLP
Валентин Малых
ИСП РАН
Руководитель лаборатории

Больше 10 лет в области AI — успел поработать в Яндексе, VK и Huawei. Защитил диссертацию по анализу текстов и сейчас является доцентом в Высшей школе цифровой культуры ИТМО. Сейчас является руководителем лаборатории в ИСП РАН. Автор телеграм-канала «Valuable AI / Валентин Малых» .

CV
Андрей Кузнецов
AIRI
к. т. н., Директор лаборатории FusionBrain

Занимается машинным обучением с 2010 года. Защитил кандидатскую диссертацию в 2013 году, пишет докторскую диссертацию про применение мультимодальных архитектур для задач обеспечения пассивной безопасности мультимедийного контента. Руководит лабораторией мультимодального генеративного ИИ FusionBrain в Институте искусственного интеллекта AIRI. Один из основателей семейства моделей Kandinsky, преподаёт в Самарском университете и ИТМО, выступает с лекциями и пишет о событиях в AI и ML в телеграм-канале «Complete AI» . Автор более 150 научных публикаций, в том числе в топ-журналах (Q1/Q2) и сборниках конференций Core A/A*. Индекс Хирша — 20.

Data Science
Александра Мурзина
Яндекс Go
AI Marvel

В составе команды AI Marvel трансформирует бизнес-направления Яндекса, внедряя AI- и ML-решения в ключевые процессы компании. Ранее отвечала за исследования новых методов ИБ в команде безопасности Городских сервисов, до 2024 года возглавляла направление машинного обучения в Positive Technologies.

Как это было в 2025-м

Место проведения
Москва, Loft Hall #8
Волочаевская ул., 48, стр. 1

Будьте в курсе новостей Practical ML Conf

FAQ