Владислав Офицеров
Яндекс Поиск
Руководитель службы развития нейронных технологий
Руководит службой развития нейронных технологий. Отвечает за работу агентского чата в международном приложении Yandex AI.
КМС по русскому бильярду и активный игрок в падел.
Василий Висков
Яндекс R&D
Руководитель команды мультимодального образования Фотоинпута Алисы
Выпускник ВМК МГУ и Сколтеха, аспирант Сколтеха.
Четыре года делал разнообразный ML в поисковых системах: сначала в VK, затем в Мегамаркете и Самокате.
В Яндексе отвечает за образовательные сценарии в Alice AI VLM — от базового навыка решения STEM-задач до продуктовых проектов образовательной направленности.
Увлекается картингом и автоспортом в целом.
11:00-12:00
Сбор участников
12:40-13:15
Доклад
World models для физического AI
В докладе расскажу о подходе world models к физическому AI и о его сравнении с доминирующим подходом — VLA/LLM, обучаемым методом клонирования поведения (обучение с подражанием).
Разберём, почему моделирование среды лучше, чем обучение традиционных реактивных политик управления, и как ковариантный сдвиг ломает реактивную политику во время работы, тогда как world model позволяет перепланировать действия под новые цели и ограничения без сбора новых демонстраций и перетренировки. Также пройдёмся по основным семействам world models: пиксельным и латентным, JEPA и Dreamer/RSSM.
Я покажу демо робототехнического управления на основе world models и в конце расскажу о моём проекте на базе Dreamer/RSSM на GitHub, с помощью которого можно обучить собственную world model и использовать её по MPC — модели прогнозирующего управления — на ноутбуке.
Николай Смолянский
Независимый исследователь
Ранее в Microsoft занимался технологиями машинного зрения и AI — Kinect, HoloLens, интеллектуальными агентами для поддержки.
Сейчас работает в Nvidia, где руководит созданием глубоких нейронных сетей для стека автономных беспилотных автомобилей.
Принимал участие в создании нейронных сетей для машинного зрения с использованием камер, LiDAR и Radar для предсказания поведения, планирования и управления, а также работал над пайплайнами для обучения на основе world models. Сейчас работает над world models для физического AI.
Среди его проектов — сквозная модель вождения Alpamayo, нейросети для робототехнического стека Isaac и система автономной навигации с нейросетями Redtail для мобильных роботов.
13:20-13:55
Доклад
От рекомендательного стека к одной генеративной модели в Яндекс Музыке
End-to-end одностадийные генеративные рекомендательные модели — перспективная активно развивающаяся область. Несколько компаний уже заявили об успешной реализации этого подхода.
В своём докладе я расскажу, как нам удалось заменить весь стек рекомендательной системы Яндекс Музыки, состоящий из множества кандидат-генераторов, нескольких этапов ранжирования, сотен признаков, в том числе нейросетевых (включая Argus), на end-to-end генеративную нейросеть без ручного фича-инжиниринга.
Новая модель продемонстрировала значительный рост всех пользовательских метрик при полной замене старой системы. Поделюсь сложностями, с которыми мы столкнулись, расскажу,
как их удалось преодолеть. Покажу результаты офлайн-замеров
и онлайн-А/В-тестов.
Николай Савушкин
Яндекс R&D
Руководитель службы рекомендательных технологий
Закончил МГУ, последние четыре года занимается базовыми рекомендательными технологиями Яндекса. Увлекается бегом на длинные дистанции.
14:10-14:45
Доклад
Как мы учим Alice AI LLM
Современная LLM должна одновременно обладать фактическими знаниями, работать с длинным контекстом, разбираться в отдельных предметных областях, решать задачи, следовать инструкциям, сохранять нужный стиль общения и многое другое. Все эти свойства приходится совмещать в одной модели, и улучшение каждого из них требует отдельного подхода.
В докладе — о том, как мы решаем эту задачу при обучении Alice AI LLM. Разберём, как мы диагностируем слабые места модели, готовим данные для развития разных навыков и масштабируем пайплайн обучения.
Отдельно поговорим об алайнменте: зачем использовать несколько reward-моделей для разных аспектов качества, как объединять их сигналы и что делать, когда они начинают конфликтовать. На практических примерах покажу, как возникают reward hacking и неожиданные деградации модели, а также расскажу, какие подходы помогают их обнаруживать и исправлять.
Александр Боймель
Яндекс R&D
Руководитель отдела разработки Alice AI LLM
Последние несколько лет отвечает за машинное обучение Alice AI LLM — флагманской языковой модели Яндекса, ранее известной как YandexGPT. Руководит полным циклом обучения: от претрейна, на котором закладываются знания и базовые способности модели, до алайнмента, превращающего их в полезное и управляемое поведение в пользовательских продуктах. Alice AI LLM лежит в основе чата с Алисой AI, используется в Поиске и других сервисах Яндекса.
До этого пять лет занимался качеством ранжирования Яндекс Поиска и отвечал за обучение моделей семейства YATI. Эти трансформерные модели научили Поиск глубже оценивать смысловую связь между запросом пользователя и содержанием веб-страниц и стали одним из крупнейших обновлений ранжирования Яндекса за десятилетие.
14:50-15:25
Доклад
Как мы развивали трансформерный item-энкодер в рекомендательной модели
Расскажу, как мы развивали item-энкодер в нашей модели: заменили DCN трансформерной архитектурой, стабилизировали обучение и оптимизировали производительность. Разберу проблемы, с которыми мы столкнулись при обучении и работе с torch.compile, причины отказа от gradient clipping и реализацию собственного self-attention на Triton. Также поделюсь результатами архитектурных и оптимизационных экспериментов и покажу, как новая модель проявила себя в A/B-тесте.
Дмитрий Веснин
Авито
Старший ML-разработчик
Окончил магистратуру Университета ИТМО. Работал младшим научным сотрудником в СПб ФИЦ РАН, а затем ML-инженером в командах рекомендательных систем «Циана» и Ozon. Сейчас в «Авито» развивает рекомендательные модели на основе трансформеров.
15:30-16:05
Доклад
Agentic Vision: как научить VLM рассуждать и использовать инструменты
Современные VLM часто ошибаются в деталях, подсчёте объектов и пространственных отношениях. Один из способов повысить качество — дать модели возможность не отвечать сразу, а построить план, получить дополнительную визуальную информацию, вызвать внешние инструменты и скорректировать решение по результатам промежуточных шагов.
В докладе разберём Agentic Vision VLM модели: планирование, visual reasoning, работу с регионами изображения, вызов OCR, детекторов, поиска и исполняемого кода. Обсудим, как обучать модель выбирать инструменты и выстраивать траекторию решения, а также как оценивать качество таких систем.
Данил Кашин
Яндекс R&D
Руководитель команды претрейна VLM
Руководит командой предобучения VLM в Яндексе. До этого работал в Циане и VK. Окончил НИЯУ МИФИ, выступал приглашённым лектором в МИФИ, НИУ ВШЭ, МГТУ им. Н. Э. Баумана и онлайн-школе AI 360. Призёр двух хакатонов. Занимается компьютерным зрением, мультимодальными моделями и развитием их способности рассуждать.
16:10-17:10
Кофе-брейк
17:10-17:45
Доклад
Строим экономически эффективный инференс LLM для агентских (и не только) сценариев
Агентские сценарии заметно меняют профиль нагрузки на большие языковые модели. Контекст растёт от шага к шагу, значительная его часть повторно используется, между обращениями одной сессии возникают паузы, а несколько агентов могут одновременно создавать резкие всплески нагрузки. В результате эффективность инференса определяется не только скоростью вычислений, но и тем, где хранится KV-кеш, на какую реплику попадёт следующий запрос и как распределены ресурсы между prefill и decode.
В докладе разберём особенности агентского трафика на основе нескольких публичных трасс, агентских бенчмарков и опыта эксплуатации моделей в Yandex AI Studio. Затем зададим SLO, запустим базовую конфигурацию на опенсорс-движке инференса и посчитаем себестоимость обработки такого трафика.
После этого будем последовательно снижать стоимость инференса с помощью выбора подходящей схемы параллелизма, KV-aware-маршрутизации, спекулятивного декодирования, разделения prefill и decode и многоуровневого распределённого KV-кеша. Для каждой техники рассмотрим, какие особенности нагрузки требуют её применения, разберём принцип её работы, готовность опенсорсных реализаций и эффект в реальной системе.
На примерах из эксплуатации DeepSeek-V3.2, DeepSeek-V4-Flash и других больших моделей покажем, почему современный инференс — это не только модельный движок, но и сложная распределённая система. Также разберём несколько нетривиальных ошибок на границах её компонентов, с которыми мы сталкивались.
Владислав Носивской
Yandex Cloud
Руководитель группы инференса LLM в Yandex AI Studio
Занимается запуском, эксплуатацией и оптимизацией больших языковых моделей. Начал карьеру в Яндексе со стажировки, посвящённой исследованию сдвигов распределения в нейронных сетях. Развивает опенсорс-инструменты для LLM-инференса и является коллаборатором проекта Mooncake.
17:50-18:25
Доклад
Эффективный Online RL для больших MoE LLM
Online RL — одна из ключевых стадий посттренинга современных LLM. Именно здесь модель учится рассуждать, следовать сложным инструкциям и решать многошаговые задачи. Однако на практике наивная реализация RL-пайплайна приводит к простоям дорогих GPU и плохой утилизации кластера.
В докладе — о том, как мы масштабировали инфраструктуру Online RL для наших MoE-моделей: как переходили на асинхронный пайплайн и ускоряли синхронизацию весов, как внедряли FP8-обучение и почему ускорение инференса напрямую определяет скорость RL-цикла. Поделюсь реальными проблемами, с которыми мы столкнулись, и тем, как их решали.
Отдельно обсудим вызовы, которые возникают при переходе к большим MoE-моделям: как на масштабе 100B+ параметров ускорение пайплайна начинает конфликтовать со стабильностью обучения и что с этим делать.
Никита Ермолаев
SberDevices
Руководитель команды инфраструктуры обучения Text LLM в GigaChat
Окончил мехмат МГУ. Начинал карьеру в VK: занимался нейросетевым ранжированием в поиске, затем перешёл к обучению LLM.
В команде GigaChat занимается инфраструктурой и оптимизацией претрейна и RL-обучений больших языковых моделей.
Сейчас фокусируется на эффективном масштабировании претрейна и посттрейна MoE-моделей уровня 100B–1T параметров в large-scale-сценариях.
18:30-19:05
Доклад
Alice AI Search: быстрые ответы Алисы на Поиске
Алиса на Поиске — один из самых массовых генеративных продуктов Яндекса, а для миллионов пользователей — и первая точка взаимодействия с Алисой.
За последнее полугодие мы существенно обновили технологии генеративного ответа на Поиске: от собственной претрейн-модели с encoder-decoder MoE-архитектурой до RLHF-обучения на реальных поведенческих сигналах пользователей.
В докладе мы впервые расскажем о том, что работает под капотом знакомого всем ответа на Поиске: какая LLM-архитектура используется, за счёт чего мы ускоряем наши ответы и какой алайнмент мы делаем, чтобы улучшать пользовательский опыт.
Артур Петросян
Яндекс Поиск
РРуководитель DL Alice AI Search
В Яндексе с 2017 года.
Руководил командами на разных стадиях разработки LLM: от сбора данных для претрейна до улучшения способностей ризонинга моделей Alice AI и YandexGPT.
Сейчас отвечает за LLM-модель Алисы на Поиске, чьи ответы каждый день видят миллионы пользователей Яндекса.
19:10-20:00
Интеллектуальная игра «Слабое звено. ML Edition»
20:00-20:20
Итоги главного розыгрыша
В день конференции проведём розыгрыш для офлайн-участников. Подробности можно будет узнать в день мероприятия на стойке регистрации.
20:20-23:00
Афтерпати и нетворк
Василиса Григорьева
Яндекс R&D
ML-разработчик в службе рекомендательных технологий
Начинала карьеру в бэкенд-команде VK, сейчас занимается обучением генеративных моделей для рекомендаций.
Кандидат в мастера спорта по триатлону. Свое утро начинает с латте-арта.
Арина Гертель
Яндекс R&D
Старший разработчик в службе компьютерного зрения
Окончила ННГУ и НИУ ВШЭ, стажировалась и работала в Intel, Huawei и Сбере.
Сейчас занимается претрейном мультимодальной модели Alice AI. Интересуется эффективным инференсом нейронных сетей, их сжатием и различными оптимизациями.
Недавно ездила на учёбу в Peking University и была частым гостем в Chagee.
11:00-12:00
Сбор участников
13:20-13:55
Доклад
Пока вы говорите: как устроен стриминговый перевод речи
Потоковый перевод вы слышите в реальном времени, не дожидаясь завершения всей речи говорящего. Расскажу, как мы сделали такую систему для перевода с английского на русский: как учили потоковый ASR и переводную LLM, какие архитектуры сравнивали, почему в итоге остановились на выбранной и почему выдача по предложениям.
Отдельно разберём главный компромисс любой стриминговой системы — задержку против качества. Откуда она берётся на каждом этапе пайплайна, как мы её измеряли и что помогло её сократить, не потеряв в метриках. Покажу, как мы сегментировали поток на предложения и что делали с нестабильностью гипотез на границах. И, конечно, поделюсь граблями, которые собрали по дороге.
Вилиана Девбунова
Яндекс R&D
Research ML Engineer в команде ASR
Четыре года в Яндексе занимается речевыми технологиями: делала нейронный синтез для немецкого и арабского, синтез на self-supervised-токенизации речи. Недавно закончила работу над потоковым переводом речи en-ru. Сейчас учит Audio Language Model контекстному распознаванию и работает над инклюзивным ASR — распознаванием речи людей с речевыми нарушениями. Параллельно исследует управляемость и механистическую интерпретируемость больших языковых моделей: работа про evaluation awareness вышла на воркшопе ICBINB на ICLR 2026. Ездит на спортивном мотоцикле и убеждена, что это тоже задача про минимизацию задержки.
14:50-15:25
Доклад
RL meets Browser: как мы обучили VLM-агента работать в вебе за пользователя
Computer-Use-агенты — модели, которые сами выполняют действия в компьютерной среде вместо пользователя, — постепенно перестают быть демо и становятся рабочей технологией. Но путь от «у нас есть VLM» до «агент выполняет задачи пользователя в проде» гораздо длиннее, чем кажется: живой браузер не детерминирован, эпизоды длинные, а рецептов multi-turn RL для мультимодальных агентов почти нет в открытом доступе.
Расскажу, как мы построили и обучили VLM-агента, который выполняет задачи в реальном браузере: начинали с booking-сценария, сейчас масштабируемся до широкого спектра пользовательских задач. Разберём архитектуру пайплайна и объясним, почему одной VLM недостаточно. Покажу, как мы завели RL в сетапе, где агент действует в настоящем браузере: как проектировали награды для длинных цепочек решений на основе скриншотов и что потребовалось, чтобы обучение стало стабильным. Отдельно поговорим про инфраструктуру — как встроить браузер в RL-пайплайн, добавить мультимодальность в тренировочный фреймворк, какие велосипеды пришлось построить, а какие выбросить — и про полуавтоматическую генерацию окружений, которая позволяет масштабировать среды, не утонув в ручной разметке.
Не обойду и грабли: что пошло не так, какие решения оказались контринтуитивными и что мы сделали бы иначе.
Артемий Голиков
Яндекс Алиса AI и Умные устройства
Руководитель бригады визуальных агентов в Алисе
Закончил ВМК МГУ. Более пяти лет занимается NLP. Сейчас в Яндексе руководит командой визуальных агентов в Алисе, учит Алису работать в Браузере. До этого занимался созданием арабского ассистента в Яндексе; начинал с работы в VK и Сбере. Любит чинить сломанные модельные тренировки, кататься на горных лыжах и путешествовать.
15:30-16:05
Доклад
Диффузионный драфтинг в спекулятивном декодинге: DFlash и DSpark — от модели до вывода в продакшн
Диффузионные драфтеры — новое направление в спекулятивном декодировании, где блок кандидатов генерируется преимущественно параллельно, а не токен за токеном. Кратко рассмотрю развитие подходов к многотокенному предсказанию и разберу, как идеи параллельного драфтинга реализованы в DFlash и получили дальнейшее развитие в DSpark.
Основное внимание уделю архитектурным инновациям в этих методах: non-causal drafting в DFlash, восстановлению зависимостей между токенами с помощью Markov head в DSpark, а также использованию confidence head для динамического выбора длины верификации.
Отдельно расскажу о практической интеграции таких моделей в inference-системы. На примере реализации в vLLM и vLLM-Ascend рассмотрю работу со статическими формами тензоров, CUDA и ACL Graph, буферами, padding, batch descriptors и различиями между draft и target проходами. Также расскажу о типичных ошибках, ограничениях аппаратных платформ и компромиссах между качеством драфта (acceptance rate), стоимостью верификации и итоговым ускорением генерации.
Доклад будет полезен исследователям и ML-инженерам, которые занимаются ускорением инференса больших языковых моделей, speculative decoding и интеграцией новых архитектур в высокопроизводительные inference-фреймворки.
Станислав Илюшин
Huawei
Старший инженер
Закончил ФКН НИУ ВШЭ. Со второго курса бакалавриата работал в Ростелекоме над классическим NLP, а во время учёбы в магистратуре перешёл в Сбер, где занимался дообучением LLM. После окончания магистратуры перешёл в Huawei, где сейчас занимается ускорением инференса, пишет статьи и контрибьютит в опенсорс. Среди профессиональных интересов — методы оптимизации, среди непрофессиональных или житейских — Counter Strike и рестораны.
16:10-17:10
Кофе-брейк
17:50-18:25
Доклад
Commodity LLM: как мы строим инфраструктуру и процессы для массового инференса LLM
Использование облачных LLM по API часто недоступно из-за работы с чувствительными данными, поэтому модели приходится разворачивать внутри корпоративного контура. Собственный массовый инференс LLM не только страхует риски регуляторной политики, но и позволяет управлять SLA и приобретать необходимый экспертный опыт, чтобы эксплуатировать свои собственные дообученные и опенсорс-модели, недоступные у внешних вендоров.
Однако у такого подхода есть жёсткое ограничение: затраты на собственный массовый LLM-инференс не должны превышать цену токенов у внешних провайдеров, иначе инхаус-решение становится экономически нецелесообразным.
На практике добиться этого сложно. Без постоянной работы над внутренней инфраструктурой и её оптимизации, а также без единого конвейера, связывающего подготовку, бенчмаркинг, оптимизацию и деплой, внедрение новых SOTA-моделей затягивается, а эксплуатация неоптимизированных моделей сжигает бюджет на железо.
В докладе — о том, как мы строим инфраструктуру для массового инференса LLM в компании и какие инфраструктурные оптимизации позволили нам за последние полгода снизить стоимость массового LLM-инференса в несколько раз. Также разберём, как мы выстраиваем единый пайплайн вывода LLM в продакшен и системы бенчмаркинга моделей по качеству и перформансу, которые позволяют нам разворачивать наиболее cost-эффективные SOTA-модели.
Александр Мисевич
Т-Банк
Руководитель Group Of Efficient Runtime & Inference в AI Platform & Copilot
В Т-Банке с 2022 года. До этого занимался разработкой современных CPU в компании Intel, затем работал в Huawei над оптимизациями обучения и инференса нейросетей под устройства компании.
Теперь руководит командой G.E.R.I., которая стала центром экспертного опыта в сфере инференса нейросетей в Т-Банке. Каждый день команда работает над тем, чтобы сделать LLM и другие сложные AI-модели технологически и экономически доступным стандартным инструментом для любых бизнес-задач.
20:20-23:00
Афтерпати и нетворк
Дарья Фомина
Яндекс R&D
Разработчик в службе ML-инфраструктуры R&D
Выпускница бакалавриата факультета компьютерных наук НИУ ВШЭ.
Карьеру начала со стажировки в Яндексе, затем работала над платформой обработки данных в VK, а потом вернулась в Яндекс, чтобы делать бэкенд для супераппа в Турции. Сейчас работает в команде базовой ML-инфраструктуры Яндекса, где разрабатывает RL-инфраструктуру для обучения LLM. Интересуется низкоуровневыми оптимизациями для GPU.
В свободное время любит путешествовать.
12:00-12:40
ML News
Наши эксперты обсудят ключевые новости в области машинного обучения и искусственного интеллекта за последние несколько недель. Они расскажут о том, что привлекло их внимание, и поделятся своими личными мнениями.
13:20-13:55
Доклад
Ouroboros: что внутри агента, обошедшего Codex, Claude Code и Cursor
Может ли агент улучшать сам себя и не деградировать?
Ouroboros — действующий эксперимент: кодинг-агент с конституцией, памятью и правом коммитить в собственный репозиторий. На открытых бенчмарках он впереди Codex, Claude Code и Cursor. В докладе — об архитектуре, петле самоулучшения и граблях, на которые мы наступили: от агентов, подсматривающих ответы, до правок, чуть не убивших систему.
Антон Разжигаев
AIRI
Старший научный сотрудник FusionBrain Института AIRI, руководитель группы «Интерпретируемый ИИ»
PhD. Руководит группой «Интерпретируемый ИИ» лаборатории FusionBrain в Институте искусственного интеллекта AIRI.
Работает над интерпретируемостью нейросетей и агентными системами; вместе со своей группой изучает, на что опирается модель и как строить агентов, которым можно давать автономию.
Автор телеграм-канала AbstractDL .
19:05-19:25
Итоги розыгрыша для зрителей трансляции
В этом году впервые проведём розыгрыш для онлайн-участников. Подробности опубликуем утром 19 сентября в канале конференции.
Илья Мурзин
Яндекс R&D
ML-разработчик в службе рекомендательных технологий
Учится в магистратуре НИУ ВШЭ и ШАД, занимается генеративными моделями в рекомендациях, интересуется подходами SOTA LLM.
В свободное время играет в падел.
11:00-12:00
Сбор участников
13:20-13:55
Доклад
Yet Another Closed-loop Teleoperation
Расскажу, как мы обучили единую end-to-end-модель управления всем телом гуманоида. Она самостоятельно координирует движения и поддерживает равновесие робота — от ходьбы, приседаний и наклонов до поднятия предметов и взаимодействия с тяжёлыми объектами, охватывая широкий спектр необходимых нам сценариев.
Андрей Маношин
Yandex Robotics
ML-инженер
Учился в МИФИ на инженера-физика. На старших курсах университета пошёл в Data Science.
В конце 2021 года стал стажироваться в Yandex Research, улучшать Sample Efficiency в RL. В середине 2022 года перешёл в штат делать модели, управляющие роборуками, а после — роботами.
Сейчас работает над VLA-моделями для гуманоидов. Вместе с командой исследует новые возможности и модальности VLA-моделей.
14:50-15:25
Доклад
Дальше, точнее, быстрее: query-based-детекция для автономного транспорта
Система восприятия автономного автомобиля должна одновременно видеть далеко, детектировать точно и укладываться в жёсткий бюджет времени на edge-устройстве. Наша CNN-based-архитектура на базе BEVFusion даёт обзор на 250 м вперёд и назад и на 100 м по бокам, но масштабировать дальность не получается: любое расширение зоны видимости упирается либо в качество детекции, либо в скорость инференса.
Расскажу, как мы перешли на query-based-модель MV2DFusion и сняли это ограничение: боковой обзор уже вырос с 100 до 200 м, а дальность вперёд и назад архитектура позволяет увеличить с 250 до 400 м: это наши следующие планы. Разберём, почему выбрали именно эту модель и как сравнивали с BEVFusion по дальности, точности, скорости и потреблению ресурсов.
Основная часть доклада — про архитектуру: как устроена query-based-модель и что происходит с её компонентами при переезде. Покажу, как адаптируются разные головы и модули детектора, как всё это работает с мультимодальными данными автономного автомобиля и какие особенности возникают при обучении. Отдельно сравню инференс до и после — по каждому компоненту и по модели в целом в процентах.
Разберу готовый кейс оптимизации ML-модели с конкретными цифрами и решение классической дилеммы разработки: как расширить охват данных (дальность обзора), сохранить качество и при этом стать быстрее.
Иван Лунев
Яндекс Автономный транспорт и роботы
Руководитель команды ядра детекции службы восприятия сцены, ведущий разработчик
Отвечает за функциональность детектора в автономном автомобиле: команда добавляет в модель новые головы под задачи автономного транспорта, улучшает качество детекций и развивает архитектуру. Выпускник матмеха СПбГУ и ШАД. До Яндекса занимался ADAS. Помогает с преподаванием алгоритмов и машинного обучения в ШАД, читает лекции об автономном транспорте в вузах и студкемпах.
15:30-16:05
Доклад
Как мы научили GigaChat Audio ориентироваться во времени: temporal grounding для длинных аудиозаписей
В работе с аудио всё чаще важно не только распознавать речь, но и понимать длинную запись целиком: отвечать на вопросы, строить суммаризацию и находить нужный фрагмент. Для этого Audio LLM должна понимать не только, что произошло, но и когда именно. В докладе разберём temporal grounding для длинного аудио и покажем, что даже сильные модели могут давать верный смысловой ответ, но ошибаться в тайм-кодах на минуты.
Расскажем, как построили полный пайплайн time-aware Audio LLM и как контролировали качество данных: собрали и опубликовали синтетический датасет объёмом 13 тыс. часов и 1 млн семплов, адаптировали архитектуру модели и добавили inter-timings — временные якоря между аудиотокенами. На записях до 50 мин такой подход снизил ошибку до 3,5 с против 66 с — у модели без inter-timings и 290 с — у Qwen3-Omni-30B-A3B. Также обсудим, сколько данных нужно для обучения, как выбирать частоту временных меток и зачем смешивать аудио разной длины.
Александр Куцаков
Сбер
Staff Research Engineer
Занимается моделями GigaAM и GigaChat Audio в Сбере уже два года. Закончил ПМИ ВШЭ и ШАД. Любит совмещать интересный research и пользу для продукта.
16:10-17:00
Кофе-брейк
17:00-19:35
Дискуссия и награждение Yandex ML Prize
20:20-23:00
Афтерпати и нетворк