Qwen 3.8: Max, Flash, Next и 27B — разбор линейки и локальный запуск

Кот в наушниках сидит за ноутбуком в уютной комнате с элементами интерфейса и текста, рекламирующими Qwen 3.8 и его версии Max, Flash, Next и 27B.

Я человек простой: вижу новую LLM — первым делом пробую установить на локалку. Но сначала лезу в интернет, почитать, что пишут те, кто уже попробовал. В эти дни в центре внимания — новый Qwen 3.8, и в интернете по поводу него сплошь и рядом плач и стоны: «Купил, включил, не работает». А разгадка проста: скачали не ту модель. Дело в том, что в этот раз под вывеской Qwen 3.8 выпустили целый выводок. Запутаться и правда легко. Давайте же расставим все точки между 3 и 8, и разберемся, что есть что, сколько стоит, какое железо потребуется и как скачать Qwen 3.8 и запустить локально.

Что входит в линейку Qwen 3.8

Уж не знаю, был ли это хитрый китайский план или само получилось, но путаницы Qwen Studio навела с самого начала. «Qwen 3.8» фигурирует в СМИ как единая модель, но это название означает сразу 3,8 разных вещей: облачный флагман на 2,4 триллиона параметров, компактная версия на 27B для домашней видеокарты, дешевый облачный Flash, архитектурное превью будущей Qwen4 и свежий омни-модуль для звука и видео.

Отделим же мух от котлет и пройдемся конкретно по каждому пункту.

Qwen 3.8 Max: облачный флагман

Продакшен-эндпоинт для тех, кому нужен максимум. Архитектурно это модель на модной нынче базе MoE (смесь экспертов). Она имеет внушительные 2,4 трлн параметров, из которых на каждый токен работает около 95 млрд. С одной стороны, типичное для современных моделей ограничение, чтоб инференс не тормозил. С другой — для одного токена это реально МНОГО. Например, у Grok 4.6 всего около 1,5 триллиона параметров, из них на токен активизируется порядка 25 млрд.

Контекстное окно составляет 1 млн токенов: до 991 тысячи на вход и до 131 тысячи на выход. На вход модель принимает текст, картинки и видео, на выход отдает текст. Глубину рассуждений можно регулировать уровнями low, medium и xhigh.

Собственные цифры Qwen внушительны: GPQA Diamond — 92,6, Terminal-Bench 2.1 — 86,6, FrontierSWE — 73,5. Для обычного пользователя это переводится просто:самая умная Qwen, которую можно вызвать по API.

В общем, с «попугаями» у Qwen 3.8 Max всё более чем хорошо. А как с ценами?

Сравнение цен на API: Qwen 3.8 и другие флагманы

Цены указаны в долларах США за 1 миллион токенов (вход / выход). Данные округлены, у некоторых провайдеров возможны скидки или тарифы с кэшированием.

Модель Провайдер Вход, $/1M Выход, $/1M Примечания
Qwen 3.8 Max QwenCloud $2.00 $6.00 Кэш чтения ~$0,25
Qwen 3.8 Flash QwenCloud / Alibaba $0.15 $0.47 Кэш ~$0,016–0,02
Qwen3.8-2.4T-A95B QwenCloud $2.00 $6.00 Открытое ядро Max, цена как у API
GPT-5.2 OpenAI $1.75 $14.00 Кэш −90% ($0,175)
Claude 4.5 Opus Anthropic $5.00 $25.00 Кэш чтения $0,50
Gemini 3.5 Ultra Google $5.00 $20.00 Тяжёлая 推理, агентные задачи
Llama 4 Scout Meta (через провайдеров) $0.11 $0.34 Контекст 10M, очень дешёвый вход
DeepSeek V4 Pro DeepSeek $0.66 $1.98 Цены после 75% снижения, вне пика дешевле

Для российских пользователей цены в долларах, конечно, имеет опосредованное значение. Поскольку оплата через агрегаторы обычно идет в рублях с наценкой за конвертацию и доступ, важны не столько суммы, сколько порядок величин и сравнительная позиция в списке. А по сравнительной позиции картина такая:

  1. Qwen 3.8 Max находится в средней ценовой категории: он заметно дешевле Claude Opus 4.5 и Gemini 3.5 Ultra, но дороже GPT-5.2 по выходным токенам. При этом по бенчмаркам Max сопоставим с топовыми моделями Anthropic, что делает его привлекательным для агентных задач, где важен баланс цены и качества.
  2. Qwen 3.8 Flash — один из самых дешевых вариантов среди современных флагманов. Его цена практически идентична Llama 4 Scout и значительно ниже GPT-5.2 и Claude. Это делает Flash оптимальным для высоконагруженных сценариев с длинным контекстом (до 1M токенов).

При этом локальный запуск Qwen 3.8 27B через GGUF полностью снимает вопрос токенов — вы платите только за электричество и железо. Но об этом ниже.

Qwen3.8-2.4T-A95B: открытое ядро Max

Здесь видим ту же «смесь экспертов»: 2,4 трлн параметров всего, около 95 млрд активных, 512 экспертов, гибридное внимание. Но есть и существенные отличия от облачной версии. Открытый чекпоинт — текстовый: картинок и видео он не понимает, а режим рассуждений принудительно включен.

Надо сказать, что модель распространяется под лицензией не Apache, а кастомной qwen3.8-max. Для большинства команд это вполне комфортные условия, но очень крупным MaaS-провайдерам и продуктам с огромной аудиторией придется договариваться отдельно.

Главное препятствие к локальной установке ядра — размер. На диске в BF16 модель занимает около 4,9 ТБ, и даже агрессивный однобитный GGUF от Unsloth весит примерно 397 ГБ. Обычным ПК, даже с самой передовой видеокартой, тут не обойдешься — нужна серверная стойка.

Но есть и компромиссный вариант.

Qwen 3.8 27B: «Квен у нас дома»

Комикс с изображением мальчика, просящего мать купить Qwen 3.8, женщины, отвечающей, что Qwen 3.8 уже есть дома, робота из коробок с надписями и спящего кота.

Как бы тоже Qwen 3.8, но не совсем. По характеристикам — плотная мультимодальная модель, еще год назад это было прям круто:

  • 27 млрд параметров,
  • визуальный энкодер,
  • 64 слоя,
  • hidden size 5120,
  • нативная длина контекста 262 144 токена (с YaRN растягивается до миллиона).

На вход принимает текст, изображения и видео. Режим рассуждений включен по умолчанию, но его можно выключить или переключить на low, medium и xhigh.

Конечно, для сентября 2026 года уже не айс, но зато — лицензия Apache 2.0, которая разрешает коммерческое использование, дообучение и дистрибуцию без потолка по аудитории.

Именно поэтому вокруг 27B мгновенно выросла экосистема — GGUF-кванты, сторонние сборки, локальные агенты.

Ну и по сравнению с предшественницей Qwen3.6-27B прогресс заметный.

Бенчмарк Qwen3.6-27B Qwen3.8-27B Прирост
Terminal-Bench 2.1 63,4 73,0 +9,6
SWE-bench Pro 53,5 61,7 +8,2
DeepSWE 1.1 13,3 42,2 +28,9
LiveCodeBench v6 83,9 90,3 +6,4
OSWorld-Verified 63,9 84,3 +20,4
WebArena-Verified 48,8 64,8 +16,0

Архитектура у обеих моделей одна и та же. Для локального запуска это удобно — если у вас уже установлен 3.6, достаточно сменить файл весов. Прыжок в производительности обеспечен не новым «скелетом», а посттренингом, особенно в сценариях с длинными агентными цепочками и работой в браузере. Кодинг также ускорился, но менее драматично — на 6–10 пунктов.

Qwen 3.8 Flash и Qwen 3.8 Next

Еще одна маркетинговая склейка, которая объединила под одним именем «коня и трепетную лань».

Qwen3.8-Flash-Next

Это не урезанный Max, а превью архитектуры Qwen4 — открытые веса от 26 августа 2026 года. Контекст нативно 262K, расширяется до миллиона. Мультимодальность на месте. Лицензия — Qwen Community 1.0.

Главная модель имеет скромные 125 млрд параметров, из которых на токен активируется около 6 млрд. Плюс таблица N-gram-эмбеддингов на 51 млрд, которая расширяет память и знания модели без роста вычислительных затрат, а также Multi-token prediction примерно на 4 млрд — встроенный ускоритель генерации, который позволяет модели предсказывать сразу несколько токенов вперед.

Эти два компонента — блестящий инженерный компромисс, который делает Qwen3.8-Flash-Next особенной:

  • N-граммная таблица позволяет модели быть «умнее», но при этом оставаться «легче» для железа, так как эти параметры не нагружают VRAM.
  • Multi-token prediction позволяет модели быть «быстрее», генерируя несколько токенов за раз, и делает высокопроизводительный инференс доступным даже на потребительском оборудовании.

Вместе они создают модель, которая по качеству близка к флагманам, но по требованиям к железу и скорости работы больше похожа на компактные решения. N-gram-таблицу специально проектировали так, чтобы ее можно было держать в обычной оперативной памяти или даже на SSD, а не в видеопамяти — GPU не нужен!

Qwen 3.8 Flash

Продакшен-обертка этой линии в API: 1 млн токенов контекста по умолчанию, встроенные инструменты и цена около 0,15–0,16 $ за миллион входных токенов и 0,47 $ за миллион выходных. Примерно в 12–13 раз дешевле Max.

По цифрам Qwen модель держится рядом с 27B на кодинге — SWE-bench Pro 62,5 против 61,7 — и чуть выше на GPQA Diamond: 91,7 против 89,2.

Это не «младший брат» Qwen3.8-Max, а другой компромисс: дешевле считать, тяжелее хранить.

Qwen3.8-Omni-Flash: звук и видео на входе

Самый свежий релиз от 18 сентября 2026 года, позиционируемый как «нативная омни-модель». Ну как «омни»: на входе текст, картинка, аудио и видео, на выходе текст. Я бы не отказался, чтобы модель генерировала еще картинки и музыку, но нет, в этом счастье отказано. Такое себе «омни» made in China.

Контекст — 1 млн токенов. По заявлению команды, качество работы с аудио и видео близко к Gemini 3.8 Flash, а средний балл по десяткам внутренних тестов вырос больше чем на 25% относительно Qwen3.5-Omni-Plus.

Весов на момент выхода нет — только API. Если нужно разобрать часовое совещание или ролик со звуком, вполне годится. Но версию 27B на домашней карте не заменит.

Инфографика с сравнением моделей Qwen 3.8: Max, Flash, 2.4T-A95B, 27B, Next и Omni с характеристиками и рекомендациями по выбору.

Что значит «27 миллиардов параметров» и много ли это

Если совсем просто, 27 млрд параметров, или 27B (27 биллионов, как говорят в США) — это количество «настроек» внутри нейросети. Представьте огромный пульт с миллиардами ручек. Чем их больше, тем более сложные и тонкие вещи нейросеть может запомнить и воспроизвести.

Но тут есть важный нюанс: «много» и «мало» — понятие относительное. Всё зависит от того, с чем сравнивать.

Для дома — очень много (и даже избыточно)

Для запуска на локальном компьютере 27B — «тяжеловес». Чтобы такая модель работала, ей нужно примерно 16–18 ГБ видеопамяти (в сжатом 4-битном формате). Это уровень хорошей игровой видеокарты, вроде RTX 4090 или 3090. Для сравнения, модели на 7–8B, которые тоже могут быть очень умными, спокойно запускаются на ноутбуке и занимают в разы меньше памяти.

Вывод: 27B — это «золотая середина» для энтузиаста. Она дает серьезный интеллект, но требует продвинутого железа.

Для индустрии — «малыш» (но очень способный)

Если сравнивать с флагманами от OpenAI, Google или Meta, то 27B выглядит скромно. Почти все они используют Mixture-of-Experts (MoE) — архитектуру, где модель состоит из огромного числа параметров, но на каждый запрос активируется лишь небольшая их часть. Поэтому цифры там совсем другие:

  • GPT-5: около 500 миллиардов общих параметров, из которых 90 миллиардов активны в каждый момент.
  • Llama 4 Scout: 109 миллиардов общих параметров с 17 миллиардами активных.
  • Gemini 3: по оценкам, от 1 до 7 триллионов параметров.

Вывод: по «общему весу» Qwen 3.8 27B в десятки раз меньше топовых моделей. Однако, благодаря свежему посттренингу, на конкретных задачах (особенно агентных и кодинге) она может работать лучше, чем некоторые гораздо более крупные открытые модели. Например, обходит в тестах Llama 4 Scout с его 109B.

Сравнительная таблица моделей Qwen 3.8

Сведем главное о линейке в одну картину:

Max 2.4T-A95B 27B Flash-Next / Flash Omni-Flash
Что это облачный флагман открытое ядро Max плотная VLM для дома превью Qwen4 / дешевый API омни-модель в API
Параметры 2,4T, 95B актив. 2,4T, 95B актив. 27B плотные 125B + 51B n-gram, 6B актив. на базе Flash
Вход текст, фото, видео только текст текст, фото, видео текст, фото, видео текст, фото, аудио, видео
Контекст 1M 262K 262K, до 1M 262K, в API 1M 1M
Открытые веса нет да да да — Next нет
Лицензия API qwen3.8-max Apache 2.0 Community 1.0 API
Железо облако стойка, от 400 ГБ 16–24 ГБ в Q4 96–128 ГБ памяти облако
Цена API за 1M ~2 $ / 6 $ как Max ~0,4—0,5 $ / 1,5–3 $ ~0,15 $ / 0,47 $ омни-тариф
Кому брать сложные агенты свое ядро Max локально и в продукт дешевый поток аудио и видео

Что же выбрать? Ориентируйтесь на конкретную задачу и следите за руками:

  • нужен максимум качества и не страшно платить — Qwen 3.8 Max;
  • нужен свой сервер уровня датацентра — 2.4T-A95B;
  • нужен домашний или офисный локальный контур — Qwen 3.8 27B;
  • нужен дешевый поток и длинный контекст по API — Qwen 3.8 Flash;
  • хочется потрогать архитектуру Qwen4 у себя — Qwen 3.8 Next;
  • нужна обработка звука и видео на входе — Omni-Flash.

Qwen 3.8 локально: требования к железу

А теперь для сумрачных хикки вроде меня, которые предпочитают крутить LLM на локалке, а не в подозрительном облаке.

Для локальной установки, как вы поняли, нужно качать Qwen 3.8 27B или Flash-Next, если памяти действительно много. Max со своими 2,4 трлн параметров на домашний ПК не встанет физически.

Ориентиры по объему памяти для квантов Qwen 3.8 27B — по сборкам Unsloth:

Квант Размер файла Реалистичный минимум
1-бит UD-IQ1 6–7 ГБ 8–12 ГБ, качество уже страдает
2-бит 8–10 ГБ 12 ГБ видеопамяти
3-бит 12–14 ГБ 16 ГБ
4-бит — рабочий стандарт 16–18 ГБ 24 ГБ: 4090, 3090, 5080 — или Mac на 24–32 ГБ
5–6-бит 20–25 ГБ 24–32 ГБ, контекст короче
8-бит 29–32 ГБ 32–48 ГБ
BF16 ~55 ГБ от 64 ГБ

Понятно? Не очень? Тогда растолкую «на пальцах».

Примерные расчеты по установке Qwen 3.8 27B локально

Если у вас видеокарта на 24 ГБ — смело ставьте модель в 4-битном сжатии (Q4). Она займет примерно 16–18 ГБ, и останется еще на «блокнот» — KV-кэш. Это место, куда она записывает всё, что уже было сказано в диалоге. Чем больше блокнот, тем более длинный контекст модель может держать в голове. Длинная статья или несколько десятков страниц переписки занимает порядка нескольких десятков тысяч токенов.

Если вы бедный ПК-боярин с 16 ГБ VRAM, 4-битная версия может не влезть. Берите более сильное сжатие — Q3 или IQ4. И не ставьте слишком большой контекст, иначе «блокнот» забьет всю память, и модель начнет тормозить или вылетать.

Если вам нужно, чтобы модель понимала картинки, нужен дополнительный файл — mmproj. Это как «очки» для нейросети. Весит он меньше гигабайта, но без него картинку она не увидит.

Также, если «закрома» GPU позволяют, можно подумать про MTP, или Multi-Token Prediction. Обычно модель выдает слова по одному. А с MTP она как бы забегает вперед и угадывает несколько слов сразу. В итоге скорость размышления растет с примерно вдвое, но за это нужно заплатить 1–2 ГБ дополнительной видеопамяти.

По моей практике, на ПК минимальный осмысленный сетап получается такой:

  • RTX 4070 Ti Super, 3090, 4090 или 5080,
  • RAM от 32 ГБ,
  • NVMe-диск.

Если у вас Mac — от 24 ГБ объединенной памяти, лучше 36–64.

Примерные расчеты по локальной установке Qwen 3.8 Flash-Next

Flash-Next — другая лига железа. Однобитные сборки занимают 72–75 ГБ, хорошие четырехбитные — 94–111 ГБ, BF16 — около 355 ГБ. Зато активных параметров всего 6 млрд, а n-gram-таблицу можно вынести в оперативку или на SSD.

Практический минимум — 96–128 ГБ объединенной памяти. Вполне сгодится Mac Studio на 128 ГБ, рабочая станция со 128 ГБ RAM плюс видеокарта или связка из нескольких GPU. Ставить на 64 ГБ можно даже не пытаться — тормоза гарантированы.

Как скачать Qwen 3.8 и запустить локально

Инфографика с рекомендациями по железу для локального запуска модели Qwen 3.8 с различными уровнями от ноутбука до серверов с несколькими GPU.

Официальные веса лежат в открытом доступе. Вот основные репозитории:

  • 27B: huggingface.co/Qwen/Qwen3.8-27B, есть и FP8-вариант Qwen/Qwen3.8-27B-FP8;
  • большое ядро: Qwen/Qwen3.8-2.4T-A95B;
  • Next: Qwen/Qwen3.8-Flash-Next;
  • зеркало ModelScope — удобный вариант, если Hugging Face капризничает.

Для домашнего запуска рекомендую брать не сырой BF16, а Qwen 3.8 GGUF. Самый ходовой репозиторий — unsloth/Qwen3.8-27B-GGUF, для Next — unsloth/Qwen3.8-Flash-Next-GGUF.

А теперь давайте посмотрим, как это счастье развернуть на своей локалке.

Вариант 1. LM Studio — проще всего

Самый дружелюбный сценарий для тех, кто не хочет трогать терминал. Вот инструкция по шагам:

  1. Скачайте и установите LM Studio.
  2. В каталоге моделей найдите Qwen3.8 или qwen/qwen3.8-27b.
  3. Выберите квант под вашу память: на 24 ГБ — UD-Q4_K_XL или Q4_K_M, это 16–18 ГБ.
  4. Включите GPU offload на максимум, контекст начните с 8–32K, а не с 262K.
  5. Если нужен разбор картинок — подтяните multimodal projector.
  6. Для обычного чата уровень рассуждений можно снизить до medium или выключить: ответы станут короче и быстрее.

Вариант 2. llama.cpp — для тех, кто любит контроль

Тут понадобится свежий билд: у поколения 3.8 гибридное внимание и MTP, старый бинарник может не завестись.

Скачивание и запуск выглядят так:

huggingface-cli download unsloth/Qwen3.8-27B-GGUF \
—include «UD-Q4_K_XL*» \
—local-dir ./qwen38-27b
llama-server \
-m ./qwen38-27b/Qwen3.8-27B-UD-Q4_K_XL.gguf \
-ngl 99 \
-c 32768 \
—jinja \
—port 8080
Copy

Если в репозитории есть MTP-голова — добавьте флаги -md и —spec-type draft-mtp: на подходящей карте это почти удваивает скорость генерации.

После запуска API совместим с OpenAI-клиентами по адресу http://127.0.0.1:8080/v1.

Вариант 3. vLLM и SGLang — сервер на несколько пользователей

Для 27B в FP8 или BF16 достаточно одной команды:

vllm serve Qwen/Qwen3.8-27B \
—max-model-len 32768
Copy

Для длинного контекста и вызова инструментов сверяйтесь с актуальными флагами reasoning-parser и tool-call-parser в рецептах vLLM под Qwen3.8.

Версии Flash-Next и Max 2.4T требуют экспертного и тензорного параллелизма и МНОГО видеопамяти — это уже совсем другая история.

Настройки, без которых модель тупит

Установить мало, надо еще и настроить. Официальные доки рекомендуют такие параметры:

  • для режима рассуждений — temperature 1.0 и top_p 0.95,
  • для обычного чата — temperature 0.7, top_p 0.8 и presence_penalty около 1.5.

Важно: не копируйте системный промпт от Llama! У Qwen свой шаблон чата, и в llama.cpp лучше включить флаг --jinja, чем городить самодельный формат. Если ответы внезапно «поехали» — первым делом проверяйте шаблон, а не квант.

Доступность в России

Если вы читаете наш сайт, то уже знаете, что с доступом к Qwen в России всё не так однозначно. Но это проблема решаемая — а по большинству сценариев даже комфортная.

  • Веб-чат. Официальный chat.qwen.ai открывается в России без VPN, для полноценной работы понадобится аккаунт.
  • Агрегаторы. Российские агрегаторы нейросетей BotHub и GPTunnel дают доступ к моделям Qwen в привычном чат-интерфейсе и по API: OpenAI-совместимый эндпоинт, оплата в рублях картами российских банков, для юрлиц — договоры и закрывающие документы. В GPTunnel промокод AIMARKETCAP10 даст скидку 10% на пополнение. Для чисто API-сценариев есть и специализированный шлюз Zveno AI. Один нюанс: свежие версии моделей появляются в каталогах с небольшим лагом, поэтому перед пополнением баланса проверьте, что нужная вам Qwen уже подключена.
  • Локальный запуск. Самый надежный путь. После скачивания GGUF интернет не нужен вообще. Веса лежат на Hugging Face и ModelScope, причем ModelScope стабильно работает в России, а HF иногда требует терпения. Никаких аккаунтов и региональных ограничений — файл на диске, модель в памяти.
  • Оплата официального API. Model Studio от Alibaba Cloud оплатить российской картой напрямую сложно — эту задачу и решают агрегаторы с рублевыми тарифами.

Вывод

Еще пару лет назад фраза «ИИ флагманского уровня на домашнем компьютере» звучала как фантастика. Сегодня это уже реальность: достаточно скачать один файл на 17 Гб и потратить вечер на вдумчивую настройку. Линейка Qwen 3.8 хороша тем, что в ней найдется вариант под любое железо и любые амбиции — от бесплатного чата в браузере до собственного сервера.

Часто задаваемые вопросы

Можно ли пользоваться Qwen 3.8 без интернета? Toggle
Да — после скачивания GGUF-файла модель работает полностью офлайн. 27B в кванте Q4 — это один файл на 16–18 ГБ.
Qwen 3.8 MoE — это какая именно модель? Toggle
В поколении две MoE: гигантская 2.4T-A95B с 95 млрд активных параметров и Flash-Next с 6 млрд активных. 27B — плотная модель, каждый токен гоняет все 27 миллиардов.
Есть ли официальный GGUF от Alibaba? Toggle
Нет, официально публикуются safetensors и FP8. GGUF собирают Unsloth и сообщество — для локального запуска это нормальная практика.
Нужен ли VPN для Qwen 3.8? Toggle
Для скачивания весов — нет: ModelScope работает в России стабильно. Доступ к API с оплатой в рублях дают российские агрегаторы, а локальная модель живет вообще без аккаунтов.
Чем Qwen 3.8 27B хуже Max? Toggle
Активных параметров у нее почти в сто раз меньше, но на домашних задачах разрыв скромнее, чем кажется по цифрам. Max нужен там, где задача длинная, дорогая и не должна сбиться на сотом шаге.
Стоит ли переходить с Qwen 3.6 на 3.8? Toggle
Если 3.6-27B закрывает ваши задачи — можно не спешить. Ради агентного кода, длинных задач и зрения в одном файле переход оправдан: архитектура та же, достаточно сменить GGUF-файл.