Свой ИИ-сервер дома: как поднять DeepSeek, локальный ChatGPT с поиском и автокодинг без подписок
Платить по двадцать долларов за ChatGPT, Claude и Cursor одновременно стало привычкой. За год набегает под восемьдесят тысяч рублей, аккаунты регулярно блокируют при малейшей смене IP, а рабочий код компаний запрещено отправлять на сторонние серверы.
При этом в области открытых весов произошел сильный сдвиг. Старые монолитные модели уступили место архитектурам смеси экспертов (MoE) и специализированным reasoning-сетям. Сегодня домашняя видеокарта на 12-24 гигабайта крутит модели, которые еще год назад требовали серверной стойки за миллион рублей.
Мы собрали и протестировали законченный рабочий стек: от серверного бэкенда с суб-3-битными квантами до веб-интерфейса с локальным поиском и автокодинга в IDE.
Шаг 1. Актуальные модели и правильные кванты под VRAM
Главное ограничение локального запуска — объем видеопамяти (VRAM). Если веса не помещаются в чип и сбрасываются в оперативную память (RAM), скорость генерации падает с комфортных 30-50 токенов в секунду до непригодных 2-3 токенов.
Раньше для экономии памяти брали мелкие 7B-модели, которые заметно уступали облачным сервисам в сложной логике. Сейчас используют алгоритмы нелинейного квантования (IQ-кванты, EXL2). Они сжимают веса до 3 или даже 2.5 бит на параметр с сохранением математической связности. Это позволяет запускать тяжелые 32B-сетки на обычных потребительских картах.
Кстати, если вы хотите протестировать все самые свежие модели уровня Claude Sonnet 5, GPT-5.6 или Gemini 3 в одном удобном месте и сравнить их ответы без костылей с иностранными картами — на платформе SYNTX.AI это можно сделать за пару кликов.
По промокоду NEIROSKUF дадут 15% скидку на все тарифы.
Вот рабочая раскладка моделей:
8 ГБ VRAM (RTX 3060 8GB, RTX 4060, ноутбуки):
- Для логики и точных ответов: phi4:14b (в кванте IQ3_M занимает около 6.2 ГБ).
- Для кода и скриптов: qwen2.5-coder:7b (около 5.5 ГБ).
- Для мгновенного автодополнения строк: smollm2:1.7b или qwen2.5-coder:1.5b-base.
12-16 ГБ VRAM (RTX 3060 12GB, RTX 4070, 4080):
- Основная рабочая лошадка для разработки: qwen2.5-coder:32b (в кванте IQ3_XS занимает 13.5 ГБ). Закрывает 95% задач по архитектуре, тестам и рефакторингу.
- Для сложных логических цепочек: deepseek-r1:14b или deepseek-r1:32b (в 3-битном кванте).
- Для анализа длинных контекстов: codestral:25b (окно до 256k токенов).
24 ГБ VRAM (RTX 3090, RTX 4090) или Apple Mac с 64+ ГБ Unified Memory:
- Тяжелый reasoning: deepseek-r1:32b (в полноценном Q4_K_M) или квантованный deepseek-v3 (MoE-архитектура с активацией 37 млрд параметров на токен).
- Плотный монолит для текстов: llama3.3:70b (в кванте Q3_K_M).
Шаг 2. Бэкенд: ставим и настраиваем сервер моделей
В качестве базового движка используем Ollama. Она автоматически распознает архитектуру видеокарты, корректно распределяет слои между GPU и отдает стандартный API, совместимый с OpenAI.
Ставим на сервер или рабочий компьютер:
После установки правим системный конфиг. По умолчанию сервис принимает запросы только с локального хоста и выгружает веса из памяти через пять минут простоя.
В Linux правим systemd-сервис (systemctl edit ollama.service), в Windows добавляем переменные среды пользователя:
Параметр OLLAMA_KEEP_ALIVE=24h держит модель в горячей памяти видеокарты, убирая задержку на чтение с накопителя при каждом обращении.
Загружаем актуальные веса:
Шаг 3. Веб-интерфейс, локальный поиск и RAG по документам
Общаться с моделью через консоль неудобно. Лучший открытый интерфейс — Open WebUI. Он повторяет возможности ChatGPT: хранит историю диалогов, умеет искать информацию в интернете через локальный поисковик и анализирует загруженные PDF-файлы (RAG) без отправки данных наружу.
Разворачиваем связку с приватным поисковиком SearXNG через docker-compose.yml:
Запускаем:
Открываем в браузере http://localhost:3000. При первой регистрации создается локальный администратор.
Теперь в чате работает переключатель «Web Search»: Open WebUI отправляет запрос в локальный SearXNG, выкачивает три релевантные страницы, сжимает их и передает модели как свежий контекст. Никаких платных поисковых ключей.
Для анализа документации нажимаем на плюс и загружаем файл .pdf или .docx. Встроенный эмбеддер нарежет документ на смысловые фрагменты и выдаст точные цитаты по семантическому поиску.
Шаг 4. Свой аналог Cursor в VS Code
Для интеграции в редактор кода ставим плагин Continue (доступен в маркетплейсе VS Code и VSCodium).
Открываем файл настроек плагина ~/.continue/config.json и настраиваем разделение труда: тяжелая 32B-модель отвечает за чат и рефакторинг, а сверхлегкая 1.5B-модель — за мгновенную автоподстановку кода:
Как это работает при написании кода:
- Автодополнение по Tab: Модель qwen2.5-coder:1.5b-base работает по алгоритму Fill-in-the-Middle (FIM). Она считывает код до курсора и после курсора, выдавая завершение строки или блока за 30-40 миллисекунд.
- Инлайн-рефакторинг (Ctrl+I / Cmd+I): Выделяем блок кода, жмем хоткей и пишем задачу. Модель qwen2.5-coder:32b переписывает фрагмент и показывает понятный diff прямо в файле.
- Контекстный чат по проекту (Ctrl+L / Cmd+L): Через символ @ цепляем к запросу файлы проекта, открытые вкладки или ошибки из терминала.
Реальные замеры скорости и выводы
Мы замерили работу стека на стенде с процессором Core i7-13700K, 32 ГБ RAM и видеокартой RTX 4070 Ti Super 16GB:
- Qwen 2.5 Coder 1.5B (FIM Tab Autocomplete): 95 токенов в секунду. Задержка первого токена меньше 35 мс. Работает так же мгновенно, как проприетарный Copilot.
- Qwen 2.5 Coder 32B (квант IQ3_XS, чат и правки): 28 токенов в секунду. Полный ответ на сложную задачу по рефакторингу генерируется за 8-10 секунд.
- DeepSeek R1 14B Q4_K_M (рассуждения): 36 токенов в секунду.
Где локальный стек уступает облачным подпискам: на гигантских репозиториях, где требуется сопоставить 50-100 файлов одновременно, облачные модели вроде Claude 3.5 Sonnet держат более широкое окно рабочего контекста.
Где локальный стек выигрывает полностью:
- Ноль затрат на ежемесячные подписки.
- Стопроцентная конфиденциальность: исходный код и документы не покидают видеокарту.
- Автономная работа без интернета.
- Отсутствие цензурных заглушек и отказов в генерации.
Если ваш проект требует строгой безопасности данных или надоели постоянные блокировки зарубежных аккаунтов — локальный сетап на 32B-моделях закрывает большинство ежедневных задач разработчика.

telegram.metelegram.meИсточник: vc.ru
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
