Архив рубрики ~Лента новостей~

Свой ИИ-сервер дома: как поднять DeepSeek, локальный ChatGPT с поиском и автокодинг без подписок

Свой ИИ-сервер дома: как поднять DeepSeek, локальный ChatGPT с поиском и автокодинг без подписок
Свой ИИ-сервер дома: как поднять DeepSeek, локальный ChatGPT с поиском и автокодинг без подписок

Платить по двадцать долларов за ChatGPT, Claude и Cursor одновременно стало привычкой. За год набегает под восемьдесят тысяч рублей, аккаунты регулярно блокируют при малейшей смене IP, а рабочий код компаний запрещено отправлять на сторонние серверы.

При этом в области открытых весов произошел сильный сдвиг. Старые монолитные модели уступили место архитектурам смеси экспертов (MoE) и специализированным reasoning-сетям. Сегодня домашняя видеокарта на 12-24 гигабайта крутит модели, которые еще год назад требовали серверной стойки за миллион рублей.

Мы собрали и протестировали законченный рабочий стек: от серверного бэкенда с суб-3-битными квантами до веб-интерфейса с локальным поиском и автокодинга в IDE.

Шаг 1. Актуальные модели и правильные кванты под VRAM

Главное ограничение локального запуска — объем видеопамяти (VRAM). Если веса не помещаются в чип и сбрасываются в оперативную память (RAM), скорость генерации падает с комфортных 30-50 токенов в секунду до непригодных 2-3 токенов.

Раньше для экономии памяти брали мелкие 7B-модели, которые заметно уступали облачным сервисам в сложной логике. Сейчас используют алгоритмы нелинейного квантования (IQ-кванты, EXL2). Они сжимают веса до 3 или даже 2.5 бит на параметр с сохранением математической связности. Это позволяет запускать тяжелые 32B-сетки на обычных потребительских картах.

Кстати, если вы хотите протестировать все самые свежие модели уровня Claude Sonnet 5, GPT-5.6 или Gemini 3 в одном удобном месте и сравнить их ответы без костылей с иностранными картами — на платформе SYNTX.AI это можно сделать за пару кликов.

По промокоду NEIROSKUF дадут 15% скидку на все тарифы.

Вот рабочая раскладка моделей:

8 ГБ VRAM (RTX 3060 8GB, RTX 4060, ноутбуки):

  • Для логики и точных ответов: phi4:14b (в кванте IQ3_M занимает около 6.2 ГБ).
  • Для кода и скриптов: qwen2.5-coder:7b (около 5.5 ГБ).
  • Для мгновенного автодополнения строк: smollm2:1.7b или qwen2.5-coder:1.5b-base.

12-16 ГБ VRAM (RTX 3060 12GB, RTX 4070, 4080):

  • Основная рабочая лошадка для разработки: qwen2.5-coder:32b (в кванте IQ3_XS занимает 13.5 ГБ). Закрывает 95% задач по архитектуре, тестам и рефакторингу.
  • Для сложных логических цепочек: deepseek-r1:14b или deepseek-r1:32b (в 3-битном кванте).
  • Для анализа длинных контекстов: codestral:25b (окно до 256k токенов).

24 ГБ VRAM (RTX 3090, RTX 4090) или Apple Mac с 64+ ГБ Unified Memory:

  • Тяжелый reasoning: deepseek-r1:32b (в полноценном Q4_K_M) или квантованный deepseek-v3 (MoE-архитектура с активацией 37 млрд параметров на токен).
  • Плотный монолит для текстов: llama3.3:70b (в кванте Q3_K_M).

Шаг 2. Бэкенд: ставим и настраиваем сервер моделей

В качестве базового движка используем Ollama. Она автоматически распознает архитектуру видеокарты, корректно распределяет слои между GPU и отдает стандартный API, совместимый с OpenAI.

Ставим на сервер или рабочий компьютер:

# Для Linux: curl -fsSL https://ollama.com/install.sh | sh # Для Windows и macOS: скачиваем установщик с сайта ollama.com

После установки правим системный конфиг. По умолчанию сервис принимает запросы только с локального хоста и выгружает веса из памяти через пять минут простоя.

В Linux правим systemd-сервис (systemctl edit ollama.service), в Windows добавляем переменные среды пользователя:

OLLAMA_HOST=0.0.0.0:11434 OLLAMA_KEEP_ALIVE=24h OLLAMA_NUM_PARALLEL=2

Параметр OLLAMA_KEEP_ALIVE=24h держит модель в горячей памяти видеокарты, убирая задержку на чтение с накопителя при каждом обращении.

Загружаем актуальные веса:

# Модель для сложного логического анализа и reasoning ollama pull deepseek-r1:14b # Топовая модель для кода ollama pull qwen2.5-coder:32b # Быстрый легковес для автодополнения строк в редакторе ollama pull qwen2.5-coder:1.5b-base

Шаг 3. Веб-интерфейс, локальный поиск и RAG по документам

Общаться с моделью через консоль неудобно. Лучший открытый интерфейс — Open WebUI. Он повторяет возможности ChatGPT: хранит историю диалогов, умеет искать информацию в интернете через локальный поисковик и анализирует загруженные PDF-файлы (RAG) без отправки данных наружу.

Разворачиваем связку с приватным поисковиком SearXNG через docker-compose.yml:

services: open-webui: image: ghcr.io/open-webui/open-webui:main container_name: open-webui restart: unless-stopped ports: — "3000:8080" extra_hosts: — "host.docker.internal:host-gateway" environment: — OLLAMA_BASE_URL=http://host.docker.internal:11434 — ENABLE_RAG_WEB_SEARCH=True — RAG_WEB_SEARCH_ENGINE=searxng — RAG_WEB_SEARCH_RESULT_COUNT=3 — SEARXNG_QUERY_URL=http://searxng:8080/search?q=<query> volumes: — open-webui_data:/app/backend/data depends_on: — searxng searxng: image: docker.io/searxng/searxng:latest container_name: searxng restart: unless-stopped ports: — "8080:8080" volumes: — ./searxng:/etc/searxng environment: — SEARXNG_BASE_URL=http://localhost:8080/ volumes: open-webui_data:

Запускаем:

docker compose up -d

Открываем в браузере http://localhost:3000. При первой регистрации создается локальный администратор.

Теперь в чате работает переключатель «Web Search»: Open WebUI отправляет запрос в локальный SearXNG, выкачивает три релевантные страницы, сжимает их и передает модели как свежий контекст. Никаких платных поисковых ключей.

Для анализа документации нажимаем на плюс и загружаем файл .pdf или .docx. Встроенный эмбеддер нарежет документ на смысловые фрагменты и выдаст точные цитаты по семантическому поиску.

Шаг 4. Свой аналог Cursor в VS Code

Для интеграции в редактор кода ставим плагин Continue (доступен в маркетплейсе VS Code и VSCodium).

Открываем файл настроек плагина ~/.continue/config.json и настраиваем разделение труда: тяжелая 32B-модель отвечает за чат и рефакторинг, а сверхлегкая 1.5B-модель — за мгновенную автоподстановку кода:

{ "models": [ { "title": "DeepSeek R1 14B (Reasoning)", "provider": "ollama", "model": "deepseek-r1:14b", "apiBase": "http://localhost:11434" }, { "title": "Qwen 2.5 Coder 32B (Chat & Edit)", "provider": "ollama", "model": "qwen2.5-coder:32b", "apiBase": "http://localhost:11434" } ], "tabAutocompleteModel": { "title": "Qwen 2.5 Coder 1.5B (Tab)", "provider": "ollama", "model": "qwen2.5-coder:1.5b-base", "apiBase": "http://localhost:11434" } }

Как это работает при написании кода:

  1. Автодополнение по Tab: Модель qwen2.5-coder:1.5b-base работает по алгоритму Fill-in-the-Middle (FIM). Она считывает код до курсора и после курсора, выдавая завершение строки или блока за 30-40 миллисекунд.
  2. Инлайн-рефакторинг (Ctrl+I / Cmd+I): Выделяем блок кода, жмем хоткей и пишем задачу. Модель qwen2.5-coder:32b переписывает фрагмент и показывает понятный diff прямо в файле.
  3. Контекстный чат по проекту (Ctrl+L / Cmd+L): Через символ @ цепляем к запросу файлы проекта, открытые вкладки или ошибки из терминала.

Реальные замеры скорости и выводы

Мы замерили работу стека на стенде с процессором Core i7-13700K, 32 ГБ RAM и видеокартой RTX 4070 Ti Super 16GB:

  • Qwen 2.5 Coder 1.5B (FIM Tab Autocomplete): 95 токенов в секунду. Задержка первого токена меньше 35 мс. Работает так же мгновенно, как проприетарный Copilot.
  • Qwen 2.5 Coder 32B (квант IQ3_XS, чат и правки): 28 токенов в секунду. Полный ответ на сложную задачу по рефакторингу генерируется за 8-10 секунд.
  • DeepSeek R1 14B Q4_K_M (рассуждения): 36 токенов в секунду.

Где локальный стек уступает облачным подпискам: на гигантских репозиториях, где требуется сопоставить 50-100 файлов одновременно, облачные модели вроде Claude 3.5 Sonnet держат более широкое окно рабочего контекста.

Где локальный стек выигрывает полностью:

  • Ноль затрат на ежемесячные подписки.
  • Стопроцентная конфиденциальность: исходный код и документы не покидают видеокарту.
  • Автономная работа без интернета.
  • Отсутствие цензурных заглушек и отказов в генерации.

Если ваш проект требует строгой безопасности данных или надоели постоянные блокировки зарубежных аккаунтов — локальный сетап на 32B-моделях закрывает большинство ежедневных задач разработчика.

Свой ИИ-сервер дома: как поднять DeepSeek, локальный ChatGPT с поиском и автокодинг без подписок
1telegram.metelegram.me

Источник: vc.ru

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ Видеомодель FLUX 3 генерирует картинку и звук одним проходом FLUX… Архив рубрики ~Коротко из Telegram~ Опубликована карта Вселенной: 4 миллиарда объектов и 5,6 триллиона пикселей… Архив рубрики ~Коротко из Telegram~ Anthropic открыла бесплатную Claude Academy — от новичка до разработчика… Архив рубрики ~Коротко из Telegram~ Для агента DeepSeek Harness собрали каталог из 1250 плагинов На… Архив рубрики ~Коротко из Telegram~ В Пекине открылся бар для вайбкодинга с бесплатным доступом к… Архив рубрики ~Коротко из Telegram~ Нейросеть научилась добавлять в готовое видео свет, который прячется за… Архив рубрики ~Коротко из Telegram~ Бионический протез продолжает слушать мышцы даже с отсоединённой кистью Показан… Архив рубрики ~Коротко из Telegram~ Робот-бариста в Китае выдал 202 чашки кофе за час В… Архив рубрики ~Коротко из Telegram~ Бизнес просит открыть суверенным ИИ доступ к государственным данным в… Архив рубрики ~Коротко из Telegram~ SpaceX подходила к Cognition AI с предложением о покупке —… Архив рубрики ~Коротко из Telegram~ VK требует вернуть свои приложения в App Store и начислять… Архив рубрики ~Коротко из Telegram~ Apple переписала комиссии для приложений в Евросоюзе — новые правила… Архив рубрики ~Коротко из Telegram~ Apple готова платить издателям за свежие новости в Siri AI… Архив рубрики ~Коротко из Telegram~ Анонимная модель Ox Alpha обошла конкурентов в кодинге и работает… Архив рубрики ~Коротко из Telegram~ Видеомодель FLUX 3 генерирует картинку и звук одним проходом FLUX… Архив рубрики ~Коротко из Telegram~ Опубликована карта Вселенной: 4 миллиарда объектов и 5,6 триллиона пикселей… Архив рубрики ~Коротко из Telegram~ Anthropic открыла бесплатную Claude Academy — от новичка до разработчика… Архив рубрики ~Коротко из Telegram~ Для агента DeepSeek Harness собрали каталог из 1250 плагинов На… Архив рубрики ~Коротко из Telegram~ В Пекине открылся бар для вайбкодинга с бесплатным доступом к… Архив рубрики ~Коротко из Telegram~ Нейросеть научилась добавлять в готовое видео свет, который прячется за… Архив рубрики ~Коротко из Telegram~ Бионический протез продолжает слушать мышцы даже с отсоединённой кистью Показан… Архив рубрики ~Коротко из Telegram~ Робот-бариста в Китае выдал 202 чашки кофе за час В… Архив рубрики ~Коротко из Telegram~ Бизнес просит открыть суверенным ИИ доступ к государственным данным в… Архив рубрики ~Коротко из Telegram~ SpaceX подходила к Cognition AI с предложением о покупке —… Архив рубрики ~Коротко из Telegram~ VK требует вернуть свои приложения в App Store и начислять… Архив рубрики ~Коротко из Telegram~ Apple переписала комиссии для приложений в Евросоюзе — новые правила… Архив рубрики ~Коротко из Telegram~ Apple готова платить издателям за свежие новости в Siri AI… Архив рубрики ~Коротко из Telegram~ Анонимная модель Ox Alpha обошла конкурентов в кодинге и работает…

Оставить комментарий