Команда Qwen компании Alibaba опубликовала Qwen3.8-2.4T-A95B — крупную модель архитектуры mixture-of-experts. Общее число параметров составляет 2,4 триллиона, однако для каждого фрагмента запроса используется около 95 миллиардов активных параметров.
Такой подход позволяет увеличивать объём знаний и возможности модели без пропорционального роста вычислений на каждый токен. FP8-версия предназначена для более экономичного запуска на совместимом оборудовании.
Карточка модели, условия лицензии, файлы и технические рекомендации доступны на официальной странице: Qwen3.8-2.4T-A95B-FP8 на Hugging Face
Источник: Qwen / Hugging Face
Alibaba представила гигантскую модель Qwen3.8 на 2,4 трлн параметров
Источник: Qwen / Hugging Face