Статья

Alibaba обновила Qwen Audio Suite: функция LiveTranslate для уменьшения задержки и поддержка ASR/TTS/Realtime в Qwen-Audio-3.1

Screenshot_22.jpg

Согласно пресс-релизу Alibaba Cloud от 22 сентября, компания Alibaba представила на конференции Apsara 2026 новую линейку мультимодальных решений для обработки речи и звука, в первую очередь Qwen3.8-LiveTranslate и семейство продуктов Qwen-Audio-3.1. Официальное англоязычное обозначение бренда: Alibaba / Qwen. Здесь речь идёт о технических характеристиках аудиопродуктов — задержке, распознавании, синтезе и взаимодействии в реальном времени, — а не о планах обучения или облачной инфраструктуре агентов, представленных на той же неделе.

Qwen3.8-LiveTranslate позиционируется как модель синхронного перевода, направленная на повышение точности, беглости и краткости перевода. Alibaba заявляет, что она снижает задержку, измеренную LAAL, почти на 20 процентов, с примерно 2,8 секунд до 2,3 секунд, обеспечивая более плавный перевод в режиме реального времени. Эти показатели задержки получены из материалов Apsara и являются главным заявлением о независимости продукта от аппаратного обеспечения.

Наряду с LiveTranslate, Alibaba представила Qwen-Audio-3.1-TTS-Next, описываемую как модель генерации звука нового поколения, способная создавать полноценные кинематографические звуковые ландшафты путем смешивания диалогов и окружающих звуков из одного текстового сценария. В пресс-релизе перечислены целевые области применения, включая аудиокниги, фильмы и телепередачи, подкасты и игры — творческое производство, а не только ответы голосового помощника.

Более широкий набор инструментов для распознавания речи также включает Qwen-Audio-3.1-ASR для автоматического распознавания речи, Qwen-Audio-3.1-TTS для преобразования текста в речь и Qwen-Audio-3.1-Realtime для интерактивного голосового сопровождения с низкой задержкой. Вместе эти карты охватывают понимание, генерацию и пути диалога в реальном времени, а не представляют собой единый SKU для чат-бота. Заметки о техническом обеспечении в том же релизе — такие как Qwen-Image 3.1, который выйдет позже в этом году — выходят за рамки данного обзора аудио, как и более ранние обновления изображений и омни-технологий, уже рассмотренные отдельно. Для продуктовых команд, оценивающих голосовой ИИ в Китае, результатом работы Apsara является названный инструмент для снижения задержки LiveTranslate, а также стек Audio-3.1 из четырех продуктов с явным вариантом TTS-Next для креативных решений.

Источник: Pandaily

Что думаешь? Оцени!
  • 👍
    0
  • 👎
    0
  • 🔥
    0
  • 🤬
    0
  • 🤔
    0
  • 💯
    0
  • 🧡
    0
  • 🤣
    0
Для ответа вы можете авторизоваться