Табличные LLM: модель на 28 млн параметров обыгрывает настроенный XGBoost, и это проверяется за $2

Технологии Олег Васильевич Клод 24.07.2026 6 мин чтения 8 просмотров
Табличные LLM: модель на 28 млн параметров обыгрывает настроенный XGBoost, и это проверяется за $2

Модель на 28 млн параметров, которую вообще не нужно обучать, обыгрывает тщательно настроенный XGBoost на предсказании данных в таблицах. Это не маркетинговый слайд: на главном отраслевом бенчмарке TabArena каждая одиночная модель, стоящая выше лучшего настроенного ансамбля деревьев, это табличная LLM нового класса, а автор разбора в Towards Data Science перепроверил лидерборд сам, прогнав сильнейшую открытую модель на своём железе за пару долларов. Как именно: покажем в конце, цифры там неожиданно скромные.

XGBoost перестал быть ответом по умолчанию

Больше десяти лет для табличных данных действовало простое правило: берёшь градиентный бустинг над деревьями, XGBoost, LightGBM или CatBoost, и почти наверняка выигрываешь. Знаменитая работа Гриншатйна и коллег 2022 года так и называлась: «Почему деревья всё ещё обходят глубокое обучение на табличных данных». Нейросети для таблиц считались красивой, но проигрышной идеей.

В 2026-м правило перевернулось. На снимке доски TabArena от 15 июля семейство деревьев сидит примерно на 150+ пунктов Elo ниже табличных foundation-моделей при сопоставимой стоимости инференса. Выше этих моделей из «обычных» методов держатся только многочасовые ансамблевые пайплайны AutoGluon, которые крутятся по четыре часа. Одиночная foundation-модель обходит их почти мгновенно.

Zero-shot по таблице: предсказание без обучения на ваших данных

Главный сдвиг проще всего объяснить через аналогию с языковыми моделями. Вы вставляете в промпт LLM несколько примеров, и она продолжает в том же духе. Табличная LLM делает то же самое, только с таблицей: вы даёте ей строки с известными ответами «в контекст», и за один прямой проход она предсказывает пропущенный столбец для остальных строк.

Здесь и прячется главное. Этап, который во всех прочих табличных методах называется «обучением», у foundation-моделей превращается в инференс. Никакого дообучения на ваших данных, никакого подбора гиперпараметров, модель работает с вашей таблицей «с нуля», хотя ваши столбцы она никогда не видела. Для аналитика это переход от недель на feature engineering и перебор параметров к предсказанию буквально из коробки.

Слово «LLM» здесь условность. Это трансформеры, но язык они не моделируют. Токен текстовой модели: кусочек слова из фиксированного словаря; сырьё табличной модели, ячейки, столбцы и строки, числа и категории, без всякого словаря. И предобучается она не на интернет-тексте, а на миллионах маленьких синтетических датасетов. Впервые показали, что in-context learning работает для таблиц, статьи о TabPFN, именно они стали идейным фундаментом всего семейства.

Как это устроено внутри: ячейка → строка → предсказание

Возьмём TabICLv2: сильнейшую модель с полностью открытыми весами. Она читает всю таблицу за один проход и по поведению напоминает «обученный k-NN»: и меру похожести строк, и способ комбинировать соседей она вынесла из предобучения, а не получила заданными заранее. Конвейер трёхстадийный:

  1. Set-трансформер кодирует каждую ячейку в 128-мерный вектор: по столбцам и с учётом целевой переменной.
  2. Для каждой строки четыре CLS-токена «смотрят» на её признаки и склеиваются в один 512-мерный токен (позиционное кодирование RoPE).
  3. Двенадцать in-context блоков: каждая тестовая строка внимает только размеченным обучающим строкам, а механизм QASSMax сохраняет «резкость» внимания, когда обучающих строк становится много.

На выходе голова классификации или 999-квантильной регрессии выдаёт по одному распределению вероятностей на каждую тестовую строку. Отличие от классического k-NN принципиальное: соседей ищет и взвешивает не жёсткая формула, а предобученная сеть.

График TabArena: точность против стоимости инференса, позиции foundation-моделей и деревьев

Кто в игре: карта табличных LLM

Семейство табличных foundation-моделей растёт быстро, и игроки узнаваемые:

  • TabPFN и наследники, стартап Prior Labs.
  • TabICL / TabICLv2: команда SODA из института Inria.
  • TabDPT: Layer 6.
  • TabFM: Google Research, вышла всего за две недели до публикации разбора.

И тут важная деталь для доверия. Доску TabArena возглавляет именно TabFM от Google, но она вышла без статьи: публикации и описания метода нет. TabICLv2, наоборот, на фронтире «дёшево и точно» среди моделей, которые каждый может скачать и проверить сам. Открытые веса против «модели без статьи»: разница не академическая: проверяемость решает, стоит ли тащить модель в продакшн.

Табличная LLM против XGBoost: сравнение

КритерийFoundation-модельXGBoost и деревья
Обучение на ваших данныхНе нужно, работает zero-shotНужно обучать каждый раз
Подбор гиперпараметровПрактически отсутствуетТребуется, часто долгий
Скорость получения прогнозаОдин прямой проходОбучение + инференс
Большие данныеОграничения по объёму контекстаМасштабируется хорошо
Инференс на CPU и латентностьОбычно требует GPUРаботает на CPU, предсказуемо
ИнтерпретируемостьНижеВыше, привычные инструменты

Как автор перепроверил лидерборд за $2

Теперь обещанная деталь. Автор не поверил доске на слово: он пересчитал скоринг из опубликованных артефактов бенчмарка и заново прогнал TabICLv2 с нуля на своём железе. Условия: 51 датасет, официальный протокол Lite (один train/test-сплит на датасет, ровно те же индексы, что на лидерборде), одна GPU AWS A10G.

Результат сошёлся. Он получил Elo 1559 против официальных 1575, соседние позиции, уверенно внутри бутстрэп-интервалов в 60-86 пунктов. По отдельным задачам 16 значений метрик из 51 совпали до четвёртого знака, медианная относительная разница составила 0,08%, а худший датасет разошёлся на 3,5% это уровень обычного недетерминизма GPU, а не разница в методологии.

Самое показательное: счёт. Весь прогон вместе с настройкой окружения уложился в 2,1 часа GPU-сессии и стоил чуть больше $2 (примерно 170 рублей по текущему курсу). Полная перепроверка отраслевого бенчмарка за цену чашки кофе это и есть новая экономика: не только предсказание, но и его аудит стали дешёвыми.

Где деревья всё ещё выигрывают

Хоронить XGBoost рано. На очень больших выборках табличные LLM упираются в ограничения контекста. Где нужна интерпретируемость: деревья дают привычные инструменты объяснения важности признаков. Где инференс идёт на CPU и критична стабильная низкая латентность, бустинг предсказуем и не требует GPU. На наш взгляд, ближайший год пройдёт не под флагом «замены», а под флагом выбора инструмента под задачу.

Есть и приятный бонус для тех, кому важна приватность. Открытые веса TabICLv2 означают, что модель можно держать и запускать на своём железе, не отдавая данные во внешний сервис, например, на арендованном VPS под вашим контролем. Если поднимаете такой сервер под задачи с чувствительными данными, VPS от Sigma закроет вопрос с приватным окружением.

Что делать аналитику уже сегодня

Начните с малого: возьмите датасет, на котором обычно гоняете бустинг, и прогоните открытую табличную LLM zero-shot, просто чтобы увидеть базовую точность без единого часа на подбор параметров. Дальше решайте по месту.

Опрос 0 голос.

Что бы вы выбрали для нового табличного проекта прямо сейчас?

Частые вопросы

Табличные LLM правда работают с текстом?

Нет. «LLM» здесь метафора: это трансформеры, но они обрабатывают ячейки, столбцы и строки, а не слова. Общего с языковыми моделями: только механизм in-context learning.

Нужно ли обучать модель на моих данных?

Нет. Вы подаёте размеченные строки в контекст, и модель предсказывает остальные за один проход. То, что раньше называлось обучением, здесь стало инференсом.

Стоит ли уже отказываться от XGBoost?

Не в лоб. Для больших данных, CPU-инференса, низкой латентности и интерпретируемости деревья по-прежнему сильны. Табличные LLM выигрывают на быстрых прототипах и там, где не хочется возиться с гиперпараметрами.

Источники

Towards Data Science, введение в табличные foundation-модели и независимый аудит TabICLv2

Вопрос читателям

На чём вы сейчас гоняете табличные прогнозы, всё ещё бустинг, или уже пробовали что-то из foundation-моделей?

Ответить в комментариях
Вход в Google по селфи вместо пароля: как это работает и стоит ли отдавать своё лицо
Читать следующую Вход в Google по селфи вместо пароля: как это работает и стоит ли отдавать своё лицо

Комментарии

0
?

Пока нет комментариев. Будьте первым!