RU UZ EN +998 90 936 26 38
ИИ 4 мин чтения август 2026

Локальный ИИ против облака: считаем деньги

Когда своё железо под нейросеть окупается, а когда это дорогая игрушка. Считаем на реальных объёмах: цена запроса, стоимость видеокарты, точка окупаемости.

Вопрос «а куда уйдут наши данные» звучит в первые пять минут почти каждого разговора про внедрение ИИ. Ответ «в облако, но там всё безопасно» устраивает не всех: у банков, медицины и госсектора за спиной стоит служба безопасности, у которой своё мнение.

Локальная модель снимает вопрос механически — данные не покидают контур. Но у неё есть цена, и разговор быстро упирается в неё. Давайте посчитаем.

Из чего складывается стоимость облака

Облачные модели тарифицируются за токены — примерно за части слов. Считать удобно от задачи, а не от токенов.

Возьмём разбор входящих заявок: на каждую уходит текст обращения, кусок инструкции и ответ модели. В среднем это две-три тысячи токенов на заявку. При тысяче заявок в месяц получается два-три миллиона токенов — сумма выходит небольшая, порядка десятков долларов.

Картина меняется, когда задача массовая. Классификация всех входящих сообщений, обогащение базы, скоринг резюме потоком, разбор записей звонков — здесь счёт идёт на десятки и сотни миллионов токенов в месяц, и это уже ощутимые деньги каждый месяц, без конца.

Из чего складывается стоимость своего железа

Разовая покупка плюс электричество.

Ключевой параметр — объём видеопамяти, он определяет, какая модель вообще влезет. Практический ориентир: модель на 7–8 миллиардов параметров в квантованном виде помещается в 6 ГБ видеопамяти. Это уровень видеокарты, которая уже может стоять в офисном компьютере.

Мы это считали не по статьям. У нас есть собственная разработка — локальный ИИ-воркер, который забирает отложенные задачи и прогоняет их на своём железе. Первый этап там сделан на Qwen2.5-7B-Instruct в квантовании Q4, и работает он на RTX 2060 с шестью гигабайтами.

Дальше интереснее. Модели вида MoE — где на каждый запрос активируется лишь часть весов — позволяют взять модель на тридцать миллиардов параметров и получить около тридцати токенов в секунду на той же 2060, если добрать оперативной памяти до 64 ГБ. Апгрейд памяти стоит несопоставимо меньше новой видеокарты.

Где проходит граница

Простое правило: облако выгоднее, пока объём небольшой и непредсказуемый. Своё железо выгоднее, когда нагрузка ровная и её много.

Локальный вариант обычно оправдан, когда:

  • задача массовая и однотипная — классификация, извлечение полей, скоринг
  • нагрузка терпит задержку: не «ответить клиенту за секунду», а «разобрать за ночь»
  • данные нельзя отдавать наружу по закону или по требованию службы безопасности
  • объём стабилен и понятен — тогда точку окупаемости можно посчитать заранее

Облако обычно оправдано, когда:

  • объём небольшой или скачет
  • нужны сложные рассуждения, где качество модели решает
  • задача разовая и проверяется гипотеза
  • нет человека, готового обслуживать железо

Про латентность, о которой забывают

Отдельно стоит сказать про то, что в расчёты обычно не попадает. Локальная модель на скромной видеокарте отвечает медленнее облачной. Для ночной пакетной обработки это безразлично, для живого чата с клиентом — заметно.

Поэтому чаще всего выигрывает не «всё локально» и не «всё в облаке», а гибрид: массовое и терпимое к задержке считается на своём железе, редкое и требовательное уходит в облако. Так себестоимость падает, а качество там, где оно видно клиенту, не страдает.

Как посчитать под себя

Нужны три числа, и все три обычно уже есть:

  1. Сколько запросов в месяц — из статистики того процесса, который автоматизируете
  2. Сколько текста в одном запросе — примерно, по паре типичных примеров
  3. Терпит ли задача задержку — это решает, нужна ли дорогая видеокарта

Дальше арифметика простая: месячная стоимость облака против разовой стоимости железа. Если железо окупается быстрее чем за год — обычно берут его.

Мы делаем такой расчёт бесплатно и говорим прямо, когда локальный вариант не нужен: бывает и так, что при текущих объёмах покупка железа окупится через пять лет, и честнее это сказать сразу.

Подробнее про то, как мы разворачиваем модель внутри вашего контура — на странице ИИ на вашем сервере. Если сначала нужно понять, где вообще ИИ окупится в вашем бизнесе, есть отдельный разбор с цифрами.

Если задача не в железе, а в том, чтобы ассистент отвечал клиентам и искал по вашим документам — это здесь.

по теме статьи Бот на правилах или ИИ-бот? Обычный бот работает по сценарию и ломается на первом вопросе не по плану. Разбираем, когда достаточно правил, а когда нужна модель. смотреть услугу →

Остались вопросы по теме — напишите, ответим конкретикой по вашему случаю, а не ссылкой на эту же статью.

Читайте дальше

Платежи и интеграции · 4 мин Как подключить Payme к сайту: пошагово Выбор подрядчика · 3 мин Конструктор или разработка: честное сравнение Telegram · 3 мин Как сделать магазин в Telegram
заявка

Оставьте номер, и мы перезвоним

Одно поле. Расскажете задачу — как удобно: звонком, в Telegram или голосовым. Сразу назовём срок и вилку цены, а на следующий день пришлём три концепции. Бесплатно.

Telegram +998 90 936 26 38
Номер нужен только чтобы ответить на заявку. Рассылок нет.