Компания Alibaba представила две новые мультимодальные модели — Qwen3-VL-2B и Qwen3-VL-32B, последняя из которых уже привлекла внимание специалистов. Она демонстрирует результаты, сопоставимые, а иногда даже превосходящие модели, такие как GPT-5 mini и Claude 4 Sonnet, особенно в области STEM, визуальных вопросов (VQA), распознавания текста (OCR), анализа видео и сценариев с агентами. Несмотря на наличие лишь 32 миллиардов параметров, Qwen3-VL-32B успешно конкурирует с более крупными системами, содержащими до 235 миллиардов параметров. На различных бенчмарках, включая OSWorld, модель демонстрирует выдающиеся результаты благодаря инновационной архитектуре с «иерархическим вниманием», что позволяет эффективно обрабатывать текст, изображения и видео в едином контексте. Alibaba заявляет, что Qwen3-VL-32B способна последовательно анализировать кадры видео, понимая сюжет и причинно-следственные связи, что делает ее особенно ценной для видеоаналитики и образовательных приложений. Оба решения уже доступны для тестирования через Hugging Face и Qwen Studio, где можно найти демо и API для интеграции в собственные проекты.