Ваши данные уходят в чужое облако при каждом запросе к нейросети. Договоры, переписка клиентов, база лидов, внутренние документы. Локальная LLM решает это радикально: модель крутится на вашем железе, интернет ей не нужен. В этой статье разберём, когда это реально оправдано, какое железо взять и как запустить первую модель за вечер.
Локальная LLM это языковая модель, которая работает на вашем компьютере или сервере. Не на серверах вендора. Вы скачиваете файл с весами модели, запускаете и общаетесь с ней offline.
Причин уйти от облака несколько. Первая: приватность. Ни один запрос не покидает периметр компании. Для юристов, медицины, финтеха это не прихоть, а требование. Вторая: стоимость. Платить за токены при большом объёме запросов дорого, а своя модель после покупки железа считает бесплатно. Третья: контроль. Модель не поменяют, не отключат, не поднимут цену задним числом.
Есть и цена вопроса. Локальные модели обычно слабее топовых облачных. Требуют настройки. Нужно железо. Поэтому решение не универсальное: оно про конкретные сценарии, где приватность и объём важнее максимального качества ответа.
Главный ресурс для LLM это видеопамять. Не процессор, не оперативка, а именно VRAM видеокарты. От её объёма зависит, какую по размеру модель вы сможете загрузить.
Ориентир простой. Модель на 7-8 миллиардов параметров в сжатом виде помещается в 6-8 ГБ VRAM. Это уровень бытовой игровой видеокарты. Модель на 13-14 миллиардов потребует 10-16 ГБ. Модели на 30 миллиардов и выше это уже 24 ГБ и профессиональные карты либо несколько потребительских.
Хорошая новость: без мощной видеокарты тоже можно. Модель запускается на процессоре и обычной оперативной памяти. Работает медленнее, но для несрочных задач вроде ночной обработки документов этого хватает. На Mac с чипами Apple Silicon всё ещё проще: единая память делит ресурс между процессором и графикой, и модели идут бодро прямо из коробки.
Практический вывод. Для теста и знакомства подойдёт ноутбук, который у вас уже есть. Для рабочего инструмента на отдел закладывайте видеокарту с 12-24 ГБ VRAM. Для серьёзной нагрузки на компанию нужен отдельный сервер.
Оригинальная модель хранит каждый параметр с высокой точностью и весит десятки гигабайт. Квантизация это сжатие: точность каждого числа снижают, и модель худеет в разы. Файл на 4 бита занимает вчетверо меньше места, чем полный.
Качество при этом почти не страдает. Уровень сжатия обозначают маркировкой вроде Q4, Q5, Q8. Чем больше цифра, тем выше точность и больше вес. Для большинства задач золотая середина это Q4 или Q5: заметной деградации ответов нет, а модель влезает в скромное железо.
Формат весов чаще всего GGUF. Это универсальный контейнер, который понимают почти все локальные движки. Если видите файл с расширением gguf, это готовая к запуску квантованная модель.
Моделей открытого веса десятки, и гнаться за самой большой не надо. Логика обратная: берите минимальную модель, которая решает вашу задачу.
Для черновиков текста, суммаризации писем и ответов на типовые вопросы хватает модели на 7-8 миллиардов параметров. Для кода, сложных рассуждений и работы с длинными документами имеет смысл модель покрупнее. Если работаете с русским языком, проверяйте, что модель его нормально держит: не все открытые модели одинаково хороши на русском.
Отдельно смотрите на контекстное окно. Это объём текста, который модель удерживает за раз. Для анализа договоров и длинных отчётов нужно окно побольше. Для коротких ответов достаточно базового.
Не пытайтесь заменить локальной моделью всё сразу. Разумнее собрать связку: локальная модель на приватных и объёмных задачах, облачная на том, где нужен максимум качества. О том, где нейросети вообще дают отдачу бизнесу, мы подробно писали в материале про нейросети для бизнеса.
Запускать модель руками через код не обязательно. Есть готовые движки, которые ставятся в пару кликов.
Самый простой путь это десктопное приложение с графическим интерфейсом. Устанавливаете, выбираете модель из списка, она скачивается и запускается. Чат работает как в привычном облачном сервисе, только всё offline. Это идеальный старт для знакомства.
Второй вариант это консольный движок, который поднимает модель как локальный сервис. Он даёт API, совместимый с популярным облачным стандартом. Это значит, что вашу внутреннюю систему или скрипт можно переключить с облака на локальную модель, поменяв один адрес. Такой подход нужен, когда LLM встраивают в рабочие процессы, а не просто чатятся.
Для команд, которые строят на этом продукт, локальная модель становится ядром ИИ-агентов для бизнеса: агент дёргает модель локально, а данные не утекают наружу.
Абстракция мертва без примеров. Вот где локальные LLM реально работают.
Общий принцип. Локальная LLM выигрывает там, где много однотипных запросов и высокая цена приватности. Проигрывает там, где нужен один идеальный ответ на сложный уникальный вопрос.
Не покупайте железо первым делом. Начните с того, что уже есть под рукой.
Шаг первый: поставьте десктопный движок с графическим интерфейсом на свой рабочий компьютер. Шаг второй: скачайте квантованную модель на 7-8 миллиардов параметров в формате GGUF, уровень сжатия Q4. Шаг третий: прогоните на ней три-четыре реальные задачи из вашей работы. Не абстрактные тесты, а то, чем вы правда занимаетесь каждый день.
После этого станет понятно главное: хватает ли качества и скорости. Если да, считайте, сколько запросов в день вам нужно, и подбирайте железо под нагрузку. Если нет, значит эту задачу пока лучше оставить облаку.
Локальные LLM это не про модный тренд, а про контроль над данными и стоимостью. Для одних задач они незаменимы, для других избыточны. Разобраться, где именно они дадут отдачу в вашем бизнесе, и собрать рабочую связку из локальных и облачных моделей помогаем в нашем боте: приходите с задачей, разложим по шагам.