Статья

Alibaba представила модель Qwen3.8-2.4T-A95B Weights как первый образец класса Qwen Max-Class MoE

Screenshot_258.jpg

Команда Alibaba Qwen опубликовала открытые веса для Qwen3.8-2.4T-A95B, описав её как первую модель класса Qwen-Max, выпущенную для скачивания, а не только через API. Эта разреженная контрольная точка, представляющая собой смесь экспертов, содержит около 2,4 триллиона параметров и активирует примерно 95 миллиардов токенов на 512 экспертов, при этом на каждом этапе используются 10 маршрутизируемых экспертов плюс один общий эксперт. Этот релиз отличается от предыдущих открытых релизов Qwen, таких как Qwen-Drive и более мелкие снимки кода Qwen3.8, позиционируя текстовую модель экспертных знаний для самодостаточных агентных и логических стеков, а не узкую модель восприятия или специализации в кодировании.

Архитектура основана на гибридном механизме внимания, который чередует линейные слои с управляемым вниманием и полное внимание на протяжении 92 слоев. Большинство слоев используют ограниченное рекуррентное состояние вместо растущего кэша «ключ-значение», в то время как меньшинство сохраняет полное попарное внимание для высокоточных взаимодействий. Такое сочетание призвано обеспечить приемлемую вычислительную мощность и использование памяти по мере масштабирования контекста от нативного окна примерно в 262 тыс. токенов до примерно одного миллиона с расширением. Максимальная длина выходных данных составляет до 128 тыс. токенов. Встроенные средства управления рассуждениями позволяют разработчикам регулировать трудозатраты на каждый запрос, жертвуя задержкой ради более глубоких многошаговых трассировок при кодировании, исследованиях, анализе длинных документов и рабочих процессах использования инструментов, которые накапливают системные подсказки, выходные данные инструментов и промежуточные планы.

Развертывание модели с vLLM появилось быстро, одновременно с добавлением весов. Amazon Web Services опубликовала пошаговое руководство по SageMaker HyperPod, демонстрирующее развертывание модели с vLLM на экземплярах ml.p6-b300, включая выделение кластера, квантование NVFP4 для размещения весов на узле с восемью графическими процессорами, вызов инструментов и нативное спекулятивное декодирование многотокенового прогнозирования за совместимой с OpenAI конечной точкой. NVIDIA задокументировала рецепты для SGLang, vLLM и Dynamo на GB300 NVL72, сообщив о производительности более 4000 токенов в секунду на каждый графический процессор и более 350 токенов в секунду на пользователя в FP8 в собственных тестах, с использованием путей NeMo AutoModel для обучения с учителем или LoRA после обучения на контрольных точках Hugging Face. Варианты с размещением модели также доступны у нескольких поставщиков услуг вывода.

Открытый контрольный пункт доступен только в текстовом формате под пользовательской лицензией Qwen3.8-Max с коммерческими условиями для крупных операторов, предоставляющих модель как услугу, в то время как размещенный продукт Qwen3.8-Max может отличаться по параметрам визуализации и управления режимами. Представленные поставщиком результаты тестов подчеркивают возможности исследования и следования инструкциям, а также отмечают наличие запаса производительности при выполнении более сложных задач с репозиторием. Для команд, которым требуется мощность класса Max в рамках собственной инфраструктуры, сочетание загружаемых весов и облачных и открытых сервисных решений того же периода является практической новостью: теперь можно запустить MoE 2,4T там, где операторы уже стандартизируют использование vLLM и управляемых кластеров GPU.

Источник: Pandaily

Что думаешь? Оцени!
  • 👍
    0
  • 👎
    0
  • 🔥
    0
  • 🤬
    0
  • 🤔
    0
  • 💯
    0
  • 🧡
    0
  • 🤣
    0
Для ответа вы можете авторизоваться