Архив рубрики ~Лента новостей~

Свой ИИ-сервер дома: как поднять DeepSeek, локальный ChatGPT с поиском и автокодинг без подписок

Свой ИИ-сервер дома: как поднять DeepSeek, локальный ChatGPT с поиском и автокодинг без подписок
Свой ИИ-сервер дома: как поднять DeepSeek, локальный ChatGPT с поиском и автокодинг без подписок

Платить по двадцать долларов за ChatGPT, Claude и Cursor одновременно стало привычкой. За год набегает под восемьдесят тысяч рублей, аккаунты регулярно блокируют при малейшей смене IP, а рабочий код компаний запрещено отправлять на сторонние серверы.

При этом в области открытых весов произошел сильный сдвиг. Старые монолитные модели уступили место архитектурам смеси экспертов (MoE) и специализированным reasoning-сетям. Сегодня домашняя видеокарта на 12-24 гигабайта крутит модели, которые еще год назад требовали серверной стойки за миллион рублей.

Мы собрали и протестировали законченный рабочий стек: от серверного бэкенда с суб-3-битными квантами до веб-интерфейса с локальным поиском и автокодинга в IDE.

Шаг 1. Актуальные модели и правильные кванты под VRAM

Главное ограничение локального запуска — объем видеопамяти (VRAM). Если веса не помещаются в чип и сбрасываются в оперативную память (RAM), скорость генерации падает с комфортных 30-50 токенов в секунду до непригодных 2-3 токенов.

Раньше для экономии памяти брали мелкие 7B-модели, которые заметно уступали облачным сервисам в сложной логике. Сейчас используют алгоритмы нелинейного квантования (IQ-кванты, EXL2). Они сжимают веса до 3 или даже 2.5 бит на параметр с сохранением математической связности. Это позволяет запускать тяжелые 32B-сетки на обычных потребительских картах.

Кстати, если вы хотите протестировать все самые свежие модели уровня Claude Sonnet 5, GPT-5.6 или Gemini 3 в одном удобном месте и сравнить их ответы без костылей с иностранными картами — на платформе SYNTX.AI это можно сделать за пару кликов.

По промокоду NEIROSKUF дадут 15% скидку на все тарифы.

Вот рабочая раскладка моделей:

8 ГБ VRAM (RTX 3060 8GB, RTX 4060, ноутбуки):

  • Для логики и точных ответов: phi4:14b (в кванте IQ3_M занимает около 6.2 ГБ).
  • Для кода и скриптов: qwen2.5-coder:7b (около 5.5 ГБ).
  • Для мгновенного автодополнения строк: smollm2:1.7b или qwen2.5-coder:1.5b-base.

12-16 ГБ VRAM (RTX 3060 12GB, RTX 4070, 4080):

  • Основная рабочая лошадка для разработки: qwen2.5-coder:32b (в кванте IQ3_XS занимает 13.5 ГБ). Закрывает 95% задач по архитектуре, тестам и рефакторингу.
  • Для сложных логических цепочек: deepseek-r1:14b или deepseek-r1:32b (в 3-битном кванте).
  • Для анализа длинных контекстов: codestral:25b (окно до 256k токенов).

24 ГБ VRAM (RTX 3090, RTX 4090) или Apple Mac с 64+ ГБ Unified Memory:

  • Тяжелый reasoning: deepseek-r1:32b (в полноценном Q4_K_M) или квантованный deepseek-v3 (MoE-архитектура с активацией 37 млрд параметров на токен).
  • Плотный монолит для текстов: llama3.3:70b (в кванте Q3_K_M).

Шаг 2. Бэкенд: ставим и настраиваем сервер моделей

В качестве базового движка используем Ollama. Она автоматически распознает архитектуру видеокарты, корректно распределяет слои между GPU и отдает стандартный API, совместимый с OpenAI.

Ставим на сервер или рабочий компьютер:

# Для Linux: curl -fsSL https://ollama.com/install.sh | sh # Для Windows и macOS: скачиваем установщик с сайта ollama.com

После установки правим системный конфиг. По умолчанию сервис принимает запросы только с локального хоста и выгружает веса из памяти через пять минут простоя.

В Linux правим systemd-сервис (systemctl edit ollama.service), в Windows добавляем переменные среды пользователя:

OLLAMA_HOST=0.0.0.0:11434 OLLAMA_KEEP_ALIVE=24h OLLAMA_NUM_PARALLEL=2

Параметр OLLAMA_KEEP_ALIVE=24h держит модель в горячей памяти видеокарты, убирая задержку на чтение с накопителя при каждом обращении.

Загружаем актуальные веса:

# Модель для сложного логического анализа и reasoning ollama pull deepseek-r1:14b # Топовая модель для кода ollama pull qwen2.5-coder:32b # Быстрый легковес для автодополнения строк в редакторе ollama pull qwen2.5-coder:1.5b-base

Шаг 3. Веб-интерфейс, локальный поиск и RAG по документам

Общаться с моделью через консоль неудобно. Лучший открытый интерфейс — Open WebUI. Он повторяет возможности ChatGPT: хранит историю диалогов, умеет искать информацию в интернете через локальный поисковик и анализирует загруженные PDF-файлы (RAG) без отправки данных наружу.

Разворачиваем связку с приватным поисковиком SearXNG через docker-compose.yml:

services: open-webui: image: ghcr.io/open-webui/open-webui:main container_name: open-webui restart: unless-stopped ports: — "3000:8080" extra_hosts: — "host.docker.internal:host-gateway" environment: — OLLAMA_BASE_URL=http://host.docker.internal:11434 — ENABLE_RAG_WEB_SEARCH=True — RAG_WEB_SEARCH_ENGINE=searxng — RAG_WEB_SEARCH_RESULT_COUNT=3 — SEARXNG_QUERY_URL=http://searxng:8080/search?q=<query> volumes: — open-webui_data:/app/backend/data depends_on: — searxng searxng: image: docker.io/searxng/searxng:latest container_name: searxng restart: unless-stopped ports: — "8080:8080" volumes: — ./searxng:/etc/searxng environment: — SEARXNG_BASE_URL=http://localhost:8080/ volumes: open-webui_data:

Запускаем:

docker compose up -d

Открываем в браузере http://localhost:3000. При первой регистрации создается локальный администратор.

Теперь в чате работает переключатель «Web Search»: Open WebUI отправляет запрос в локальный SearXNG, выкачивает три релевантные страницы, сжимает их и передает модели как свежий контекст. Никаких платных поисковых ключей.

Для анализа документации нажимаем на плюс и загружаем файл .pdf или .docx. Встроенный эмбеддер нарежет документ на смысловые фрагменты и выдаст точные цитаты по семантическому поиску.

Шаг 4. Свой аналог Cursor в VS Code

Для интеграции в редактор кода ставим плагин Continue (доступен в маркетплейсе VS Code и VSCodium).

Открываем файл настроек плагина ~/.continue/config.json и настраиваем разделение труда: тяжелая 32B-модель отвечает за чат и рефакторинг, а сверхлегкая 1.5B-модель — за мгновенную автоподстановку кода:

{ "models": [ { "title": "DeepSeek R1 14B (Reasoning)", "provider": "ollama", "model": "deepseek-r1:14b", "apiBase": "http://localhost:11434" }, { "title": "Qwen 2.5 Coder 32B (Chat & Edit)", "provider": "ollama", "model": "qwen2.5-coder:32b", "apiBase": "http://localhost:11434" } ], "tabAutocompleteModel": { "title": "Qwen 2.5 Coder 1.5B (Tab)", "provider": "ollama", "model": "qwen2.5-coder:1.5b-base", "apiBase": "http://localhost:11434" } }

Как это работает при написании кода:

  1. Автодополнение по Tab: Модель qwen2.5-coder:1.5b-base работает по алгоритму Fill-in-the-Middle (FIM). Она считывает код до курсора и после курсора, выдавая завершение строки или блока за 30-40 миллисекунд.
  2. Инлайн-рефакторинг (Ctrl+I / Cmd+I): Выделяем блок кода, жмем хоткей и пишем задачу. Модель qwen2.5-coder:32b переписывает фрагмент и показывает понятный diff прямо в файле.
  3. Контекстный чат по проекту (Ctrl+L / Cmd+L): Через символ @ цепляем к запросу файлы проекта, открытые вкладки или ошибки из терминала.

Реальные замеры скорости и выводы

Мы замерили работу стека на стенде с процессором Core i7-13700K, 32 ГБ RAM и видеокартой RTX 4070 Ti Super 16GB:

  • Qwen 2.5 Coder 1.5B (FIM Tab Autocomplete): 95 токенов в секунду. Задержка первого токена меньше 35 мс. Работает так же мгновенно, как проприетарный Copilot.
  • Qwen 2.5 Coder 32B (квант IQ3_XS, чат и правки): 28 токенов в секунду. Полный ответ на сложную задачу по рефакторингу генерируется за 8-10 секунд.
  • DeepSeek R1 14B Q4_K_M (рассуждения): 36 токенов в секунду.

Где локальный стек уступает облачным подпискам: на гигантских репозиториях, где требуется сопоставить 50-100 файлов одновременно, облачные модели вроде Claude 3.5 Sonnet держат более широкое окно рабочего контекста.

Где локальный стек выигрывает полностью:

  • Ноль затрат на ежемесячные подписки.
  • Стопроцентная конфиденциальность: исходный код и документы не покидают видеокарту.
  • Автономная работа без интернета.
  • Отсутствие цензурных заглушек и отказов в генерации.

Если ваш проект требует строгой безопасности данных или надоели постоянные блокировки зарубежных аккаунтов — локальный сетап на 32B-моделях закрывает большинство ежедневных задач разработчика.

Свой ИИ-сервер дома: как поднять DeepSeek, локальный ChatGPT с поиском и автокодинг без подписок
1telegram.metelegram.me

Источник: vc.ru

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Unitree Robotics выходит на IPO Новости робототехники Стартап Micro1, занимающийся разработкой решений для искусственного интеллекта, достиг годового оборота в 500 миллионов долларов на фоне бурного роста в области обучения ИИ. Архив рубрики ~Коротко из Telegram~ Игры про русскую жизнь заняли десятую часть мобильного рынка и… Архив рубрики ~Коротко из Telegram~ Забыли, как называется элемент интерфейса? Есть сервис, который найдёт название… Архив рубрики ~Обо всем~ [Перевод] Почему вообще что-то существует Архив рубрики ~Коротко из Telegram~ Google постепенно внедряет расширенный процесс установки приложений от непроверенных разработчиков…. Архив рубрики ~Коротко из Telegram~ CtxPort переносит историю диалогов между ChatGPT, Claude и Gemini Одна… Архив рубрики ~Коротко из Telegram~ ИИ-навыки стали обязательным пунктом почти во всех вакансиях для дата-сайентистов… Архив рубрики ~Коротко из Telegram~ Тепловизор и ИИ помогают увидеть кита раньше, чем в него… Архив рубрики ~Коротко из Telegram~ Бывший инженер Meta* дал показания против компании: «не спрашивай —… Архив рубрики ~Коротко из Telegram~ Австралия обязала бигтех платить за новости — 2,5% рекламной выручки… Архив рубрики ~Коротко из Telegram~ В агентах Next Move Theory нашли скрытое автообновление навыков и… Архив рубрики ~Коротко из Telegram~ ToolHazard-Bench: как проверяют ИИ-агентов на устойчивость к prompt injection Как… Архив рубрики ~Коротко из Telegram~ Один кастомный skill поднял результат Claude на ARC-AGI-3 с 30%… Новости робототехники Unitree Robotics выходит на IPO Новости робототехники Стартап Micro1, занимающийся разработкой решений для искусственного интеллекта, достиг годового оборота в 500 миллионов долларов на фоне бурного роста в области обучения ИИ. Архив рубрики ~Коротко из Telegram~ Игры про русскую жизнь заняли десятую часть мобильного рынка и… Архив рубрики ~Коротко из Telegram~ Забыли, как называется элемент интерфейса? Есть сервис, который найдёт название… Архив рубрики ~Обо всем~ [Перевод] Почему вообще что-то существует Архив рубрики ~Коротко из Telegram~ Google постепенно внедряет расширенный процесс установки приложений от непроверенных разработчиков…. Архив рубрики ~Коротко из Telegram~ CtxPort переносит историю диалогов между ChatGPT, Claude и Gemini Одна… Архив рубрики ~Коротко из Telegram~ ИИ-навыки стали обязательным пунктом почти во всех вакансиях для дата-сайентистов… Архив рубрики ~Коротко из Telegram~ Тепловизор и ИИ помогают увидеть кита раньше, чем в него… Архив рубрики ~Коротко из Telegram~ Бывший инженер Meta* дал показания против компании: «не спрашивай —… Архив рубрики ~Коротко из Telegram~ Австралия обязала бигтех платить за новости — 2,5% рекламной выручки… Архив рубрики ~Коротко из Telegram~ В агентах Next Move Theory нашли скрытое автообновление навыков и… Архив рубрики ~Коротко из Telegram~ ToolHazard-Bench: как проверяют ИИ-агентов на устойчивость к prompt injection Как… Архив рубрики ~Коротко из Telegram~ Один кастомный skill поднял результат Claude на ARC-AGI-3 с 30%…

Оставить комментарий