Локальные ИИ для установки на ПК

Помните май этого года, когда DeepSeek вдруг перестал открываться в России? Лично я запомнил очень хорошо. Дедлайн горит, надо перегонять отчеты в таблицы, а сайт не отвечает ни на десктопе, ни на смартфоне. У меня есть, конечно, подписки на несколько агрегаторов, но тратить там токены не хотелось. И вообще, подумал я, надо бы запастись резервным вариантом для подобных форс-мажоров. И нашел заботливо скачанный «на всякий пожарный» дистрибутив Ollama. Запуск установщика, одна команда, и пять гигабайт qwen3:8b загружаются по моей очень безлимитной сети. Через десять минут в терминале сидел ручной домашний «китаец», который справился с работой не хуже, чем его облачный конкурент.

Изображение, показывающее интерфейс программного обеспечения для установки локальных ИИ на ПК с рядом моделей искусственного интеллекта и преимущественными характеристиками.

Еще пару лет назад запуск нейросети на локалке был уделом энтузиастов с дорогими GPU. Сегодня адекватная модель бегает на обычном игровом ПК, а самые легкие версии запускаются даже на ноутбуке без дискретной графики. Читайте в нашем обзоре, какие модели реально ставить в 2026 году, сколько памяти они просят и чем их запускать.

Чем запускать ИИ на локалке: бесплатные оболочки

Интерфейс программы Ollama с загруженной моделью deepseek-v4-flash, отображающей информацию о параметрах модели и готовности к работе.

Напомним, что ИИ-модель представляет собой просто-напросто очень большой файл, в котором прописаны все параметры — «веса модели». Весам нужна оболочка, которая их прочитает. Вот бесплатные варианты таких оболочек:

  • Ollama — стандарт индустрии: скачивается и запускается буквально одной кнопкой, плюс локальный API в формате OpenAI.
  • LM Studio — то же самое, но с графическим интерфейсом и встроенным поиском моделей. Идеально для тех, кто не дружит с терминалом.
  • Jan и Open WebUI — привычные окна чата поверх скачанных моделей, с историей и файлами.
  • llama.cpp — движок, на котором построено все остальное. Требуется ручная настройка, но вы выиграете до трети скорости, которую теряют более «удобные» оболочки на автоматике.
  • ComfyUI — отдельная среда, подходящая для генерации картинок: умеет собирать пайплайны из блоков и спокойно тянет на ноутбуках FLUX и Stable Diffusion.

Скриншот интерфейса программы для создания и обработки изображений с использованием нейросетевых моделей и LoRA

Доступность в России

Тут всё в порядке. Каталог Ollama и сайты оболочек открываются напрямую, без регистрации и зарубежных карт. Ни одна модель из подборки не требует оплаты.

Единственное узкое место — Hugging Face, главный склад весов. Из России часть репозиториев отдается с перебоями, а модели с ограниченным доступом просят аккаунт и принятие лицензии. Обход простой: качайте через Ollama или LM Studio — они привозят те же модели в готовом формате GGUF.

ТОП-8 локальных ИИ для ПК

Мы отбирали предложения по трем критериям: запуск на потребительском железе, свободная загрузка из России, актуальность версии. Есть и универсальные модели, и узкие «специалисты».

1. Gemma 4 — лучшая точка входа

Разработчик: Google DeepMind.

Где скачать: каталог Ollama, Hugging Face, Kaggle.

Размеры: E2B, E4B, 26B A4B и 31B Dense.

Лицензия: Apache 2.0 — коммерция без ограничений.

Семейство вышло 2 апреля 2026 года и сразу изменило расклад на рынке. Плотная версия на 31B заняла третье место в чат-арене среди открытых моделей, обойдя конкурентов в 20 раз крупнее. Младшие E2B и E4B заточены под смартфоны и слабые ноутбуки, но остаются мультимодальными — понимают текст, картинки и звук. 26B A4B активирует около 4 млрд параметров из 26. Контекст старших версий — 256 тыс. токенов.

В независимых тестах на домашней карте с 16 ГБ Gemma 4 оказалась единственной, кто стабильно писал рабочие юнит-тесты и следовал нестандартным правилам проекта.

Плюсы
  • + свободная лицензия;
  • + 4 размера под любое железо, от Raspberry Pi до игрового ПК;
  • + мультимодальность;
  • + длинный контекст.
Минусы
  • - старшие версии просят 18–20 ГБ;
  • - длинный контекст обходится дороже, чем у конкурентов того же класса.

2. Qwen 3.6 — универсал с отличным русским

Разработчик: Alibaba.

Где скачать: каталог Ollama, LM Studio, Hugging Face.

Размеры: от 4B до 35B-A3B, есть версия на 8B.

Лицензия: Apache 2.0.

Если бы мне пришлось оставить одну модель на диске — это была бы Qwen. Версия 35B-A3B держит 35 млрд весов, но считает всего 3. В формате Q4_K_M файл весит ~20 ГБ и запускается даже на карте с 16 ГБ при выгрузке части экспертов в ОЗУ. Заявленные 256 тыс. токенов контекста реально достижимы. Версия на 8B укладывается в 8–10 ГБ и дает лучший баланс качества и русского языка на скромном ПК.

Плюсы
  • + сильный русский язык;
  • + огромный контекст;
  • + работает на массовом железе благодаря MoE;
  • + коммерческая лицензия.
Минусы
  • - плохо держит длинные агентские сессии — теряет нить на больших файлах;
  • - режим рассуждений хуже на медленных машинах.

3. GigaChat 3 Lightning — российская модель для ноутбука

Разработчик: Сбер.

Где скачать: Hugging Face, каталог Ollama, готовые GGUF-сборки.

Размер: 10B-A1.8B.

Лицензия: MIT.

Компактная MoE-модель на 10 млрд параметров, из которых активны 1,8 млрд. Обучена с нуля на собственном корпусе — редкий случай для российской сцены. Контекст — 256 тыс., лицензия MIT, формат GGUF — запускайте через llama.cpp, LM Studio, Jan, Ollama.

Главная сила — русский язык и локальные реалии: законодательство, документы, бюрократические контексты. Там, где зарубежная модель фантазирует с несуществующими статьями, Lightning отвечает аккуратно.

Плюсы
  • + предсказуемо хороший русский и знание местной специфики;
  • + помещается в 8 ГБ; MIT без ограничений.
Минусы
  • - на простых фактах иногда сбивается;
  • - сообщество и набор готовых сборок меньше, чем у зарубежных линеек.

4. gpt-oss-20b — рассуждения от OpenAI

Разработчик: OpenAI

Где скачать: каталог Ollama, Hugging Face.

Размеры: 20B (домашний) и 120B (серверный).

Лицензия: Apache 2.0.

Первая модель с открытыми весами от OpenAI после GPT-2 и до сих пор один из лучших вариантов для задач, где нужны именно рассуждения. Младшей версии хватает видеокарты на 16 ГБ или такого же объема единой памяти на Mac с Apple Silicon. Контекст — 128 тыс. токенов. Глубину рассуждений переключают между низкой, средней и высокой, разменивая скорость на качество.

Модель заточена под многоэтапную логику: разбор условий, планирование, цепочки выводов. Для болтовни — избыточна, для аналитики, которую не хочется отправлять в облако, — то что надо.

Плюсы
  • + регулируемая глубина рассуждений;
  • + Apache 2.0;
  • + сильная логика при скромных 16 ГБ.
Минусы
  • - русский слабее, чем у Qwen и GigaChat;
  • - не мультимодальная.

5. Qwen3-Coder 30B — локальный помощник программиста

Разработчик: Alibaba.

Где скачать: каталог Ollama, Hugging Face.

Размер: 30B-A3B.

Лицензия: Apache 2.0.

Специалист по коду. В Q4_K_M занимает ~17 ГБ и уверенно работает на карте 16–24 ГБ. Встраивается в редакторы через расширения вроде Cline и Roo Code и становится автопилотом, который не отправляет репозиторий наружу. Для компаний с закрытым контуром — единственный способ использовать ИИ-помощника вообще.

Плюсы
  • + пишет и рефакторит код офлайн;
  • + встраивается в привычные редакторы;
  • + понимает инструменты и структуру проекта.
Минусы
  • - для обычного чата избыточна;
  • - в длинных сессиях копирует файлы вместо правки оригинала.

6. DeepSeek R1 — дистилляты для математики и логики

Интерфейс приложения Ollama с открытым диалогом о ключевых особенностях модели deepseek-r1.

Разработчик: DeepSeek.

Где скачать: каталог Ollama, Hugging Face.

Размеры: дистилляты на 8, 14 и 32B.

Лицензия: MIT.

Полноразмерная DeepSeek на ПК не поместится — свежая V4 разрослась до триллиона параметров. Но дистилляты (уменьшенные копии, обученные повторять ход мысли старшей модели) отлично живут на бытовом железе. Версия на 8B укладывается в 8–10 ГБ. Такая модель сначала пишет рассуждения, потом окончательный ответ, и все в одном окне. Выглядит непривычно, но дает прирост в математике и логике.

Плюсы
  • + заметно сильнее сверстников в логике;
  • + лицензия MIT;
  • + работает на GPU среднего уровня.
Минусы
  • - многословные рассуждения удлиняют ответ;
  • - в бытовых задачах избыточна.

7. FLUX.2 klein — генерация картинок на своей видеокарте

Разработчик: Black Forest Labs.

Где скачать: Hugging Face, готовые рабочие процессы для ComfyUI.

Размеры: klein 4B, klein 9B, dev 32B.

Лицензия: Apache 2.0 (4B), у старших — некоммерческая.

Текстовыми моделями возможности локального развертывания не исчерпываются. Облегченная FLUX.2 на 4B — удобная точка входа в генерацию картинок: около 13 ГБ видеопамяти в полной точности, а в GGUF помещается и на 12 ГБ. Дистиллирована под несколько шагов — изображение появляется за секунду.

Старшие версии выглядят лучше, но версия 9B просит ~29 ГБ видеопамяти и запрещает коммерческое использование, а dev на 32B — серверная история. Универсальная альтернатива — Stable Diffusion с огромной библиотекой дообучений.

Плюсы
  • + фотореализм на уровне платных генераторов,
  • + без цензуры и лимитов.
Минусы
  • - ComfyUI требует времени на освоение;
  • - промпты — только на английском;
  • - старшие версии запрещены для коммерции.

8. Whisper — расшифровка речи офлайн

Разработчик: OpenAI.

Где скачать: Hugging Face, whisper.cpp, готовые приложения (например, Buzz).

Размеры: от tiny до large-v3.

Лицензия: MIT.

Самая недооцененная локальная модель. Whisper превращает аудио в текст с пунктуацией и отлично справляется с русским. Средние версии работают на CPU без видеокарты, а сборка whisper.cpp летает даже на старом ноутбуке. Интервью, лекции, планерки, голосовые на 10 минут — расшифровывается локально, без отправки на сервер.

Плюсы
  • + качественная расшифровка русской речи;
  • + работает без GPU;
  • + лицензия MIT и десятки готовых интерфейсов.
Минусы
  • - не разделяет спикеров в расшифровках;
  • - модель large-v3 на CPU обрабатывает запись долго.

Гиганты, которые дома не запустятся

В новостях об открытых моделях регулярно мелькают цифры, от которых захватывает дух: DeepSeek V4 (триллион), Kimi от Moonshot AI, MiniMax M3 (~300B) и флагманский GigaChat 3 Ultra (702B). Веса открыты, скачать может кто угодно. Запустить — только владелец серверных GPU. Всем остальным путь к ним лежит через облако.

Сравнительная таблица

Свели все данные воедино, чтобы помочь вам выбрать локальную модель ИИ под ваше железо.

Модель Размер Нужно памяти Задача Лицензия
Gemma 4 E2B – 31B 4 – 20 ГБ универсальный чат, картинки, звук Apache 2.0
Qwen 3.6 8B – 35B-A3B 8 – 20 ГБ универсал с сильным русским Apache 2.0
GigaChat 3 Lightning 10B-A1.8B 8 ГБ русский язык и локальные реалии MIT
gpt-oss-20b 20B 16 ГБ рассуждения и аналитика Apache 2.0
Qwen3-Coder 30B-A3B 16 – 24 ГБ программирование Apache 2.0
DeepSeek R1 distill 8B – 32B 8 – 24 ГБ математика и логика MIT
FLUX.2 klein 4B / 9B 12 – 29 ГБ генерация изображений Apache 2.0 (4B)
Whisper tiny – large-v3 2 – 10 ГБ расшифровка речи MIT

Не хватает железа? Облака с оплатой в рублях

Локальный ИИ хорош, пока вы не упираетесь в свою видеокарту. Ноутбук с 8 ГБ потянет модель на 4B — флагман она не заменит. Тогда разумнее взять доступ к топовым моделям через российские агрегаторы: без VPN, без зарубежных карт.

Проверенные площадки:

  • Study24 — крупный агрегатор текста, картинок и видео, есть бесплатный уровень;
  • GPTunnel — большой каталог моделей, промокод AIMARKETCAP10 дает 10% скидки;
  • BotHub — сайт и Telegram-бот;
  • GoGPT — недорогие тарифы, промокод AIMARKETCAP — скидка 15%;
  • FICHI.AI — единый кабинет с доступом к самым актуальным топ-моделям, промокод FICHI-5C3B452B;
  • Syntx AI — мультимодальная платформа с упором на творчество.

Честно: это уже не локальный ИИ — данные уходят на сторонний сервер, приватность как у любого облака. Но вы получаете флагманские модели без покупки GPU за сумму с пятью нулями. Разумный сценарий: локальная модель для чувствительных задач, облако — для всего остального.

Зачем нам локальный ИИ?

Помните май этого года, когда DeepSeek вдруг перестал открываться в России? Лично я запомнил очень хорошо. Дедлайн горит, надо перегонять отчеты в таблицы, а сайт не отвечает ни на десктопе, ни на смартфоне. У меня есть, конечно, подписки на несколько агрегаторов, но тратить там токены не хотелось. И вообще, подумал я, надо бы запастись резервным вариантом для подобных форс-мажоров. А что может помочь в таких ситуациях? Только локальные ИИ, установленные на собственном железе.

Нашел заботливо скачанный когда-то «на всякий пожарный» дистрибутив Ollama. Запуск установщика, одна команда — и пять гигабайт qwen3:8b загружаются по моей очень безлимитной сети. Через десять минут в терминале сидел ручной домашний «китаец», который справился с работой не хуже, чем его облачный конкурент. Ради интереса я выдернул вилку роутера из розетки. ИИ продолжил отвечать как ни в чем не бывало.

С тех пор компактная модель лежит у меня на диске как аптечка в бардачке: достаю редко, но выбрасывать не собираюсь — мало ли еще что где отвалится, обычное дело по нынешним временам.

Как устроены локальные модели ИИ

Нейросеть — это файл с миллиардами числовых коэффициентов (их принято называть «веса модели»). Чтобы она ожила, нужна программа-движок, которая загрузит эти веса в память и выполнит вычисления. Когда и файл, и движок лежат у вас на диске — это и есть локальная модель. Все равно что офлайн-плеер против стриминговой платформы.

У такого подхода четыре практических преимущества:

  • Приватность. Данные никуда не уходят с вашего компьютера. Для юриста с NDA, бухгалтера или разработчика с закрытым кодом это не бонус, а условие работы.
  • Независимость. Скачанную модель нельзя заблокировать или сделать платной постфактум. Особенно это актуально на фоне последних новостей о возможном ограничении доступа к китайским ИИ — а ведь половина российских ИИ-продуктов держится именно на открытых китайских моделях.
  • Безлимит. Никаких подписок, токенов, очередей. Платите только за электричество и амортизацию вашего ПК.
  • Гибкость. Модели можно дообучать на своих данных, кроме того, большинство локальных моделей не имеют цензурных ограничений, в отличие от своих облачных версий.

Минус тоже есть, и он весомый: домашняя модель всегда слабее облачного флагмана. Поднять GPT-5.6 или Opus на ноутбуке не выйдет. Но разрыв в мощности сокращается с каждым релизом. А для оперативных повседневных задач — черновиков, переводов, конспектов, анализа документов и ординарного кода локальных моделей уже более чем достаточно.

Что нужно, чтобы запустить нейросеть дома

В 2026 году локальные модели ИИ стали доступны даже на ноутбуках. Главный принцип: модель должна иметь возможность целиком загрузиться в память, причем желательно VRAM, а не RAM. Поэтому выбирайте варианты не по списку желаемого, а исходя из объема видеопамяти вашего устройства (или оперативки, если графика встроенная).

Вот базовые термины, которые помогут вам сориентироваться в каталогах:

  • Параметры. Цифра в названии — это миллиарды параметров. Грубо: модель на 8B просит около 8–10 ГБ памяти.
  • Квантование. Сжатие весов с 16 бит до 4–8. Стандарт — формат Q4_K_M: модель «худеет» втрое, теряя качество в пределах пары процентов.
  • MoE (Mixture of Experts). Модели вида 35B-A3B работают как набор экспертов, но в каждый конкретный момент для обсчета конкретного токена включается лишь часть из них. В памяти хранятся все веса, а в вычислении задействована только активная часть — отсюда приемлемая скорость на скромном железе.
  • Контекст. Длина диалога тоже жрет память: 256 тыс. токенов отъедают больше гигабайта сверх самой модели.
  • CPU-режим. Даже если дискретной видеокарты нет, в этом режиме запустится почти всё, но работать будет медленнее.

Железо / производительность

Примерные ориентиры по железу для локальных моделей ИИ мы свели в таблицу:

Объём памяти Какие модели тянет
8–16 ГБ ОЗУ (без GPU) модели на 2–4 млрд параметров
8–12 ГБ видеопамяти модели на 8–14 млрд + генерация картинок
16 ГБ видеопамяти MoE-модели на 26–35 млрд с выгрузкой экспертов в ОЗУ
24–32 ГБ видеопамяти плотные модели на 31 млрд и кодеры

Вывод

Локальные ИИ перестали быть увлечением энтузиастов. Обычный ноутбук → ставьте Gemma 4 (младшую) или GigaChat 3 Lightning — запустятся и бесплатны. Игровой ПК с 16 ГБ → Qwen 3.6 и gpt-oss-20b, а это уже уровень, где модель реально экономит время. Программистам — Qwen3-Coder, любителям картинок — FLUX.2 klein, тем, кто работает с записями, — Whisper, который окупает себя с первой расшифровки.

Не гонитесь за числом параметров. Модель, которая помещается в память и отвечает за секунды, полезнее гиганта, который еле ворочается. Начните с компактной версии, оцените скорость на своих задачах — и поднимайтесь выше, только когда упретесь в потолок качества. Скачать ИИ для ПК бесплатно можно за пять минут. И это лучший способ понять, нужен ли вам вообще платный облачный доступ.

Часто задаваемые вопросы

Что такое локальные ИИ простыми словами? Toggle
Это нейросеть, файл которой скачан на ваш компьютер и работает на его железе. Интернет нужен один раз — чтобы скачать модель.
Можно ли скачать ИИ для ПК бесплатно? Toggle
Да, все модели из подборки распространяются бесплатно по открытым лицензиям. Платить придется только за электричество и (при желании) за более мощную видеокарту.
Какая локальная модель лучше понимает русский? Toggle
Для бытовых задач — Qwen 3.6. Для российских реалий и документов — GigaChat 3 Lightning от Сбера.
Какой компьютер нужен для локального ИИ? Toggle
Минимум — 8 ГБ памяти для компактных моделей. Комфортный уровень — видеокарта на 16 ГБ, которая тянет модели на 20–35 млрд параметров.
Локальный ИИ заменит ChatGPT? Toggle
Полностью — нет. Облачные флагманы пока сильнее по качеству. Но для приватных задач, работы офлайн и экономии на подписке локальной модели более чем достаточно.