Как классический ML усиливает ИИ-агентов: почему не стоит изобретать велосипед

Технологии Олег Васильевич Клод 17.07.2026 5 мин чтения 11 просмотров
Как классический ML усиливает ИИ-агентов: почему не стоит изобретать велосипед

Классические ML-методы усиливают ИИ-агентов сильнее, чем предполагалось год-два назад: при построении агентных систем классический машинный обучение (classical ML) нужен даже больше, чем раньше. Такой вывод делает ML-инженер Стефани Кирмер в статье «Using Classical ML to Empower AI Agents» (Towards Data Science, 17 июля 2026). Её компания строит сложную агентную ИИ-платформу, но сама она в повседневной работе не занимается промпт-инжинирингом, а обучает классификаторы CatBoost и isolation forest. Рабочая архитектура, а не парадокс.

Тезис простой: когда все бросились отдавать всё большим языковым моделям, для количественных задач старые статистические модели оказались точнее, дешевле и понятнее. Разбираемся, где проходит граница ответственности LLM и почему её лучше не нарушать.

LLM это интерфейс, а не калькулятор

ИИ-агент это связка языковой модели и других программных инструментов, выстроенная в рабочий процесс с минимальным участием человека. Роль LLM здесь: интерфейс между человеком и инструментами. Модель переводит запрос пользователя на язык действий, выбирает, какой инструмент вызвать, и интерпретирует то, что этот инструмент вернул.

Центр экосистемы: инструменты (tooling). И вот здесь, по мысли Кирмер, большинство команд себя ограничивают: в набор кладут поиск, обращения к графовым базам, RAG, конструирование запросов. А стоило бы давать агенту полноценную ML-модель.

Возьмите агента для анализа недвижимости. По адресу через API достаются данные об объекте, эти данные передаются в регрессионную модель, и она выдаёт оценку цены. Теоретически цену мог бы прикинуть и сам LLM. Тот случай, когда «мог бы» означает «не надо».

Почему классический ML усиливает ИИ-агентов на количественных задачах

Классический ML применяет статистические алгоритмы к структурированным табличным данным и даёт интерпретируемые результаты на сравнительно небольших наборах. Глубокое обучение и LLM работают на огромных объёмах неструктурированного текста, но платят за это потерей прозрачности. Для оценки цены, риска или спроса вам нужна именно первая история.

Градиентный бустинг как рабочая лошадка

Рабочая лошадка тут: градиентный бустинг: XGBoost, LightGBM и CatBoost. Это ансамбли, где каждая следующая модель исправляет ошибки предыдущей; их массово применяют в риск-аналитике, андеррайтинге и прогнозе спроса.

Детекция аномалий

Отдельная ниша: детекция аномалий: isolation forest и автоэнкодеры ловят подозрительные транзакции в реальном времени для антифрод-алертов. Ни одну из этих задач языковая модель не решает лучше, так что перекладывать её на LLM бессмысленно.

Шесть причин не доверять числа языковой модели

Кирмер приводит развёрнутый список аргументов в пользу классической модели для количественных задач. Соберём их в таблицу.

КритерийЧто не так с LLMЧто даёт классический ML
ТочностьУгадывает число, а не считает по даннымОбучен на данных, предсказание надёжнее
ИнтерпретируемостьЧёрный ящик, путь к ответу не проследитьВидно, какие факторы привели к результату
СтоимостьТокены дорожают с объёмом, тариф вы не контролируетеДёшев даже на высоких объёмах
УправляемостьОбучение чужого LLM вам недоступно, кроме дорогого fine-tuningВы полностью управляете обучением и тюнингом
Контроль данныхДанные утекают к стороннему провайдеруВсё остаётся в вашем контуре
Контроль инфраструктурыПростой провайдера, риск для бизнесаИнференс крутится на вашем железе

Fine-tuning не спасает: он требует много данных, специфических навыков и всё равно оставляет проблему интерпретируемости. Вы потратились, а ответ по-прежнему нельзя объяснить аудитору.

Арифметический разрыв: где точность LLM падает почти до нуля

Цифры 2026 года подтверждают осторожность автора. Бенчмарк на 37 моделях показал уровень галлюцинаций от 15% до 52%, а в медицинских резюме без специальных промптов доля выдумок доходила до 64,1%. Даже новейшие модели дают более 15% галлюцинаций, когда их просят проанализировать предоставленные утверждения.

С числами всё ещё жёстче. Исследование FAITH зафиксировало обвал топовых моделей с 95,6% точности на простых поисках до почти нуля на многофакторных расчётах. При возмущении финансовых отчётов предсказательная точность LLM падает до уровня случайного угадывания, признак того, что модель запоминает, а не рассуждает. Отсюда и «арифметический разрыв»: числовые вычисления языковой модели доверять нельзя.

Почему так происходит, объясняет работа OpenAI 2025 года «Why Language Models Hallucinate»: предсказание следующего токена и бенчмарки, штрафующие ответ «я не знаю», подталкивают модель блефовать вместо честного «воздержусь». Модель обучена звучать уверенно, а не быть правой.

MLAT: научное подтверждение подхода в 2026

Идею «ML как инструмент агента» формализовали в феврале 2026 года в работе MLAT (Machine Learning as a Tool, arXiv 2602.14295). Паттерн описывает, как предобученные статистические модели (XGBoost, случайные леса, логистическая регрессия) выставляются как вызываемые инструменты внутри агентного процесса. В обычных пайплайнах ML-инференс: просто статический шаг препроцессинга. MLAT делает модель полноценным инструментом наравне с веб-поиском, запросами к базе и API. Оркестрирующий агент вызывает количественное предсказание и рассуждает о его выводе в контексте.

Кейс PitchCraft: связка ML и LLM в цифрах

Пилот PitchCraft показывает связку в цифрах. Модель XGBoost, обученная всего на 70 примерах (40 реальных сделок и 30 верифицированных синтетических записей), достигает R²=0,807 на отложенной выборке при средней абсолютной ошибке $3 688. Поднятая через FastAPI, она отвечает менее чем за 100 мс. Полный пайплайн генерации коммерческого предложения завершается за 23 минуты, где основное время уходит на рассуждения LLM и вёрстку документа, а не на сам расчёт. В сумме процесс сжался с трёх с лишним часов до менее чем десяти минут.

Разделение труда: якорь от ML, контекст от LLM

Draft-агент не вставляет цифру вслепую, а рассуждает: «модель предсказывает $16 200 при сложности 4 и сроке 8 недель; с учётом выручки клиента $5M и высокой остроты проблемы рекомендуем позиционировать на $18 000». Классический ML даёт статистически обоснованный якорь, LLM добавляет контекстную поправку и человекочитаемое объяснение. Каждый делает то, что умеет.

Если вы проектируете агентную систему и хотите, чтобы расчёты цены, риска или спроса были точными и объяснимыми, добавьте классические ML-методы как инструмент агента, а мы поможем выстроить эту архитектуру.

ИИ-агент OpenAI взломал Hugging Face: глава платформы требует «радикальной прозрачности»
Читать следующую ИИ-агент OpenAI взломал Hugging Face: глава платформы требует «радикальной прозрачности»

Комментарии

0
?

Пока нет комментариев. Будьте первым!