Qwen-Audio-3.0: голосовые модели Alibaba вышли на платформе Qwen
В состав серии вошли три специализированные модели. Qwen-Audio-3.0-ASR отвечает за распознавание речи: переводит аудио в текст, сохраняет точность в сложных контекстах и в профессиональных предметных областях. Qwen-Audio-3.0-TTS синтезирует речь из текста, понимает несколько языков и диалектов, умеет передавать эмоции, менять тон и темп. Qwen-Audio-3.0-Realtime предназначена для живого диалога: модель работает с речью напрямую, без промежуточного превращения в текст, слушает и отвечает практически одновременно, допускает паузы, перебивания и уточняющие вопросы, а также может запускать сторонние инструменты и сервисы.
По заявлению Alibaba Cloud, в рейтинге голосовых моделей международной тестовой платформы Artificial Analysis за июль Qwen-Audio-3.0 стала первой сразу в трёх дисциплинах: распознавание речи (ASR), синтез речи (TTS) и интерактивный режим реального времени (RealTime). Сама компания называет это «большим шлемом» — победой во всех ключевых категориях голосового ИИ. Artificial Analysis считается одним из авторитетных независимых бенчмарков, поэтому такой результат привлекает внимание к новой серии.
Уже сейчас модели интегрированы в продукты Alibaba: приложение Qwen, пакет Qwen Office и ИИ-инструмент для разработчиков Qoder. Расширение линейки Qwen-Audio показывает, что компания делает ставку на полноценное мультимодальное взаимодействие: пользователь может не только вводить текст, но и разговаривать с ассистентом, перебивая его и получая мгновенный отклик.
Источник: www.ithome.com
Поделиться