Сколько стоит запускать локальную LLM: евро за миллион токенов по замеру энергии GPU

Сколько стоит запускать локальную LLM? Инженер Арсен Апостолов измерил, сколько электроэнергии тратит видеокарта на генерацию токенов локальными моделями, и перевёл это в евро за миллион выходных токенов. Итог ломает интуицию: из восьми протестированных моделей пять оказались дешевле облачного API класса «Flash», три дороже. И это не те три, что можно угадать по числу параметров. Самая маленькая модель вышла не самой дешёвой, самая большая не самой дорогой.
Разберём, почему так вышло, как автор замерял энергопотребление GPU и что из этого следует для тех, кто держит инференс дома или на арендованном сервере.
«Бесплатно на своей GPU» это миф
Логика «модель крутится на моей карте, значит генерация ничего не стоит» игнорирует счётчик электричества. Каждый токен это ватты, которые карта потребляет ровно в тот момент, пока считает. Апостолов решил замерить это фактически, а не оценивать по паспортному TDP.
Стоимость токена определяет энергоэффективность: отношение потребляемой мощности к пропускной способности в токенах в секунду. Крошечная модель недогружает мощную карту и выдаёт токены медленно, поэтому энергия «размазывается» по малому их числу, и цена за токен растёт. Крупная модель держит GPU под полной нагрузкой, выдаёт высокий поток токенов и в пересчёте на один токен может оказаться дешевле.
Как измеряли стоимость локальной LLM: nvidia-smi, киловатт-часы и реальный тариф
Стенд простой: одна машина под openSUSE с единственной видеокартой RTX 3090 на 24 ГБ. Замеры снимал открытый дашборд автора, HomeLab Monitor под лицензией MIT, разворачивается одним контейнером.
Инструмент опрашивает мощность GPU из nvidia-smi каждые 10 секунд, интегрирует показания в киловатт-часы за точное окно запуска и умножает на действующий тариф. Это фактический замер потребления, а не прикидка по спецификации карты.

Тариф и условия нагрузки
Тариф взят реальный, болгарский: 0,30 лева днём и 0,18 лева ночью. По зафиксированной привязке к евро один лев равен примерно €0,5113. Разница между дневным и ночным тарифом почти 40%, к этому мы ещё вернёмся.
Нагрузка одинаковая для всех моделей: цикл генераций по 256 токенов с перебором пяти фиксированных промптов, около четырёх минут непрерывной работы. Четыре минуты нужны, чтобы карта вышла в устойчивый режим, а не оценивалась по «холодному» первому вызову, когда потребление ещё не стабилизировалось.
Формула расчёта
Формула на выходе такая:
€ за 1 млн токенов = (стоимость запуска в левах × 0,5113) ÷ (число выходных токенов ÷ 1 000 000)
Все модели запускались через ollama в формате GGUF с квантизацией Q4_K_M, то есть сравнение шло в одинаковых условиях. Среди опорных участников: gemma3:1b (крошечная), gemma4:26b (Google Gemma 4, фактически 25,8 млрд параметров, ollama округляет тег до «26b») и gemma3:27b из предыдущего поколения.
Парадокс: почему 1B может стоить дороже, чем 26B
Здесь и кроется главный сюрприз. Модель на миллиард параметров занимает меньше памяти и запускается мгновенно, но на RTX 3090 она не может загрузить карту работой. GPU часть времени простаивает или работает вполсилы, а энергия при этом тратится. Поделите потраченные ватты на скромное число сгенерированных токенов, и цена за токен взлетает.
Крупная модель эффективно утилизирует карту, держит высокий поток токенов в секунду и распределяет ту же энергию по гораздо большему объёму работы. В пересчёте на токен получается дешевле. Поэтому пять из восьми моделей уложились ниже облачного «Flash»-API, а три превысили его, и предсказать этот список по одному лишь числу параметров нельзя.
Если вы гоняете локальный инференс всерьёз, ориентируйтесь на реальную пропускную способность вашей связки «модель + карта», а не на размер файла модели.
Что замер НЕ учитывает
Проговорим ограничения. Дашборд считает только предельную электроэнергию самой видеокарты. За кадром остаётся многое:
- амортизация карты: RTX 3090 на вторичном рынке стоит порядка сотен евро, и этот капитал «сгорает» по мере эксплуатации;
- потребление процессора, оперативной памяти и блока питания сверх того, что ест GPU;
- охлаждение помещения и корпуса;
- простой оборудования между запросами: карта потребляет и когда ничего не генерирует.
«Бесплатным» можно назвать только маргинальный токен, тот, что вы добавляете к уже работающей системе. Владение всей инфраструктурой бесплатным не бывает.
Локально или облако: где точка безубыточности
Отсюда прагматичный вывод. При редких, эпизодических запросах облачный API почти всегда дешевле: вы не платите за амортизацию карты и за простой. При постоянном плотном потоке запросов локальный сервер начинает выигрывать, фиксированные затраты размазываются по большому объёму токенов.
Точка безубыточности измеряется в токенах в месяц: чем выше ваша загрузка, тем быстрее локальная карта отбивает и электричество, и свою стоимость. Если инференс работает от случая к случаю, честнее платить за облако.
| Сценарий | Что выгоднее | Почему |
|---|---|---|
| Редкие запросы | Облачный API | Нет амортизации и оплаты простоя |
| Постоянный поток | Локальная GPU | Фиксированные затраты делятся на большой объём |
| Дешёвое электричество | Локальная GPU | Главная переменная затрат резко падает |
День или ночь: как тариф меняет всю экономику
Разница между дневным и ночным тарифом в замере почти 40%. Отсюда прямая подсказка: пакетную обработку, которую не жалко отложить, логично гонять ночью. Если у вас двухзонный счётчик, ночной инференс сам по себе снижает цену за токен.
Для России и стран СНГ картина ещё интереснее. Электроэнергия здесь ощутимо дешевле болгарской, и вся арифметика смещается в пользу локального запуска: та же карта, тот же поток токенов, но переменная стоимость каждого токена ниже. Болгарские цифры автора воспринимайте как верхнюю планку, у себя вы получите меньше.
Приватность как бонус к экономике
Деньги не единственная причина держать модель у себя. Локальный инференс означает, что ваши промпты и данные не уходят в чужое облако. Для чувствительных задач это самостоятельная ценность, которую в евро за токен не измеришь.
Если поднимаете свой инференс-сервер на арендованном железе и хотите держать к нему стабильный и защищённый доступ, инфраструктура вроде VPS и VPN от Sigma закрывает вопрос приватного канала до вашей машины.
Как повторить замер стоимости токена у себя
Бенчмарк воспроизводим полностью. Дашборд HomeLab Monitor разворачивается через docker compose из репозитория SikamikanikoBG/homelab-monitor, интерфейс открывается на порту 9800, а клиент написан на чистом стандартном Python. Подставьте свой тариф, прогоните одинаковую нагрузку на своих моделях, и вы получите собственное число «евро за миллион токенов» под конкретную карту и цену электричества.
Частые вопросы
Правда ли, что запуск LLM на своей видеокарте бесплатный?
Нет. Каждый токен требует электроэнергии, а помимо этого есть амортизация карты, потребление остальных компонентов, охлаждение и простой. Бесплатным можно назвать лишь дополнительный токен на уже работающей системе.
Почему маленькая модель оказалась дороже большой?
Цену токена определяет энергоэффективность: мощность, делённая на поток токенов. Крошечная модель недогружает карту и генерирует медленно, поэтому потраченная энергия делится на малое число токенов и цена за токен растёт.
Когда локальный запуск выгоднее облака?
При постоянной плотной нагрузке, когда фиксированные затраты размазываются по большому объёму токенов. При редких запросах облачный API дешевле, потому что не приходится оплачивать амортизацию и простой.
Как дёшево снизить цену за токен?
Гоняйте пакетную обработку по ночному тарифу, выбирайте модель с высоким реальным потоком токенов под вашу карту и учитывайте более дешёвое электричество в вашем регионе.
Источники
Towards Data Science, замер стоимости локальных LLM в евро за миллион токенов




Пока нет комментариев. Будьте первым!