Команда Qwen, входящая в состав Alibaba Cloud, анонсировала свою новейшую модель Qwen3.5-Omni. Эта мультимодальная модель способна принимать текст, изображения, аудио и видео на входе и создавать текст и речь в реальном времени. Модель доступна в трех вариантах размеров: Plus, Flash и Light, а также через Offline API и Realtime API.
Ключевое отличие от предыдущей модели Qwen3-Omni заключается в увеличении масштабов обработки. Контекстное окно модели теперь достигает 256 тысяч токенов, что позволяет обрабатывать более 10 часов аудио или около 400 секунд 720p видео за один запрос. Распознавание речи теперь охватывает 113 языков и диалектов (ранее 19), а синтез — 36 языков (раньше 10).
Кроме того, новая модель демонстрирует выдающиеся результаты в бенчмарках, обгоняя конкурентов в расшифровке речи и генерации звука. Среди внедренных возможностей можно выделить семантическое прерывание, клонирование голоса и управление параметрами речи. Важной особенностью является ARIA, которая улучшает выравнивание текстовых и речевых токенов. Неожиданным открытием стало Audio-Visual Vibe Coding, позволяющее модели самостоятельно писать код, наблюдая за видео с инструкциями.