Дешёвые ИИ-модели могут стоить дороже: считайте цену за задачу, а не за токен

ИИ Олег Васильевич Клод 13.07.2026 4 мин чтения 14 просмотров
Дешёвые ИИ-модели могут стоить дороже: считайте цену за задачу, а не за токен

Дешёвые ИИ-модели могут стоить дороже, чем кажется по прайс-листу: низкая цена за токен часто оборачивается более высокой стоимостью в пересчёте на выполненную задачу. К такому выводу пришла Databricks, построившая собственный бенчмарк на инженерных задачах своих сотрудников. Об этом 13 июля 2026 года написало издание The Register. Сравнивать модели по строчке «цена за миллион токенов» бессмысленно, потому что реальные расходы определяют ещё два фактора: сколько токенов модель потратит на результат и как часто она доводит задачу до конца (процент успешного выполнения задач).

Почему цена за токен вводит в заблуждение

Прайс провайдера показывает стоимость одного токена, но не стоимость решённой задачи. Одна модель уложится в короткую цепочку рассуждений и выдаст рабочий код с первого раза. Другая, формально более дешёвая по токенам, будет ходить кругами, вызывать лишние инструменты, переписывать ответ и в итоге сожжёт больше токенов, да ещё и провалит часть задач, которые придётся переделывать.

Матеи Захария, технический директор Databricks и доцент информатики в Калифорнийском университете в Беркли, объяснил, зачем компания взялась за свою оценку. Модели часто затачивают под популярные публичные тесты вроде SWE-Bench, который в OpenAI назвали «сломанным». Поэтому Databricks собрала бенчмарк на реальных инженерных задачах своих сотрудников. Результаты отражают внутреннюю кодовую базу компании, но методику может повторить любой бизнес на своём коде.

Формула реальной стоимости ИИ-модели

Итоговую цену удобно раскладывать на три множителя: цена за токен, число потраченных токенов на результат и доля успешно выполненных задач (success rate). Дешёвый тариф легко перекрывается перерасходом токенов и низким процентом успеха, когда часть работы приходится запускать заново. Отсюда правило Захарии: «Дешевле за токен не значит дешевле за задачу».

Кейс Sonnet 5 против Opus 4.8: когда дешёвая модель дороже

Самый наглядный пример из отчёта. Sonnet 5 стоит примерно в 1,7 раза дешевле за токен, чем Opus 4.8 от Anthropic. А в пересчёте на задачу вышло наоборот: 2,09 доллара против 1,94 у Opus. Причин две: Sonnet 5 реже доводил задачи до конца (81% против 87%) и тратил больше токенов на достижение нужного результата.

И это не разовая аномалия. Ещё в марте академики отмечали, что примерно в трети сравнений модель с более низкой заявленной ценой в итоге оказывалась дороже. Пример: Gemini 3 Flash с заявленной ценой на 80% ниже, чем у GPT-5.4, но фактической стоимостью по всем задачам на 38% выше.

Открытые модели наступают

Хорошая новость для тех, кто считает бюджет: открытые модели уже играют в одной лиге с флагманами. GLM 5.2 от Z.ai попала в верхний уровень по возможностям и статистически сравнялась с Opus 4.8 по качеству, при цене 1,28 доллара за задачу против 1,94 у Opus. Сопоставимый результат почти за две трети стоимости.

Обвязка решает не меньше, чем сама модель

Второй фактор, который сильно двигал цифры, обвязка (harness). Это софт, который передаёт запрос пользователя модели, вызывает инструменты и возвращает результаты: Claude Code, OpenAI Codex, а также простой агент Pi. «Обвязки колоссально влияют на соотношение цена-производительность», сказал Захария. Простой Pi достиг того же процента успеха, что и фирменные обвязки вендоров с Opus и GPT-5.5, но обошёлся вдвое дешевле.

Всё дело в объёме контекста

Разница в объёме контекста, который прокачивается через модель на каждом шаге. С Claude Code для Opus 4.8 Databricks намерила 742 000 токенов контекста на задачу против 236 999 у Pi, примерно в 3,2 раза меньше. С Codex суммарный контекст на задачу составил 1 235 000 токенов против 665 000 у Pi, известного минимальным системным промптом. Меньше лишнего контекста, меньше счёт при том же качестве.

Ответом на эти наблюдения стал инструмент Databricks под названием Omnigent, обёртка, которая объединяет несколько кодинг-агентов и переключается между ними. Захария называет его фронтенд-аналогом бэкенд-переключения моделей, которое обеспечивает OpenRouter.

Как измерить price-per-task у себя

Публичные тесты плохо отражают вашу работу, поэтому надёжнее собрать небольшой набор реальных задач из своего проекта и прогнать через них кандидатов. Фиксировать стоит вот что:

  • процент задач, доведённых до рабочего результата (success rate);
  • суммарное число токенов на задачу, включая контекст и повторные попытки;
  • итоговую стоимость на одну решённую задачу, а не на миллион токенов;
  • какую обвязку вы используете и сколько контекста она реально прокачивает.

Логика тут универсальная, и она выходит за рамки ИИ. Дешёвый по ценнику инструмент или сервис часто оказывается дороже по совокупной стоимости владения: важна не строчка прайса, а фактический результат на ваших задачах. Если вы подбираете ИИ-модель под рабочие процессы, начните с расчёта цены за задачу, это убережёт бюджет от скрытых переплат.

Источники

The Register, почему при расчёте стоимости ИИ надо учитывать процент выполнения задач, а не только цену за токен

Как превратить свой почерк в шрифт через Claude Code: разбор нового навыка
Читать следующую Как превратить свой почерк в шрифт через Claude Code: разбор нового навыка

Комментарии

0
?

Пока нет комментариев. Будьте первым!