Табличные LLM: модель на 28 млн параметров обыгрывает настроенный XGBoost, и это проверяется за $2

Модель на 28 млн параметров, которую вообще не нужно обучать, обыгрывает тщательно настроенный XGBoost на предсказании данных в таблицах. Это не маркетинговый слайд: на главном отраслевом бенчмарке TabArena каждая одиночная модель, стоящая выше лучшего настроенного ансамбля деревьев, это табличная LLM нового класса, а автор разбора в Towards Data Science перепроверил лидерборд сам, прогнав сильнейшую открытую модель на своём железе за пару долларов. Как именно: покажем в конце, цифры там неожиданно скромные.
XGBoost перестал быть ответом по умолчанию
Больше десяти лет для табличных данных действовало простое правило: берёшь градиентный бустинг над деревьями, XGBoost, LightGBM или CatBoost, и почти наверняка выигрываешь. Знаменитая работа Гриншатйна и коллег 2022 года так и называлась: «Почему деревья всё ещё обходят глубокое обучение на табличных данных». Нейросети для таблиц считались красивой, но проигрышной идеей.
В 2026-м правило перевернулось. На снимке доски TabArena от 15 июля семейство деревьев сидит примерно на 150+ пунктов Elo ниже табличных foundation-моделей при сопоставимой стоимости инференса. Выше этих моделей из «обычных» методов держатся только многочасовые ансамблевые пайплайны AutoGluon, которые крутятся по четыре часа. Одиночная foundation-модель обходит их почти мгновенно.
Zero-shot по таблице: предсказание без обучения на ваших данных
Главный сдвиг проще всего объяснить через аналогию с языковыми моделями. Вы вставляете в промпт LLM несколько примеров, и она продолжает в том же духе. Табличная LLM делает то же самое, только с таблицей: вы даёте ей строки с известными ответами «в контекст», и за один прямой проход она предсказывает пропущенный столбец для остальных строк.
Здесь и прячется главное. Этап, который во всех прочих табличных методах называется «обучением», у foundation-моделей превращается в инференс. Никакого дообучения на ваших данных, никакого подбора гиперпараметров, модель работает с вашей таблицей «с нуля», хотя ваши столбцы она никогда не видела. Для аналитика это переход от недель на feature engineering и перебор параметров к предсказанию буквально из коробки.
Слово «LLM» здесь условность. Это трансформеры, но язык они не моделируют. Токен текстовой модели: кусочек слова из фиксированного словаря; сырьё табличной модели, ячейки, столбцы и строки, числа и категории, без всякого словаря. И предобучается она не на интернет-тексте, а на миллионах маленьких синтетических датасетов. Впервые показали, что in-context learning работает для таблиц, статьи о TabPFN, именно они стали идейным фундаментом всего семейства.
Как это устроено внутри: ячейка → строка → предсказание
Возьмём TabICLv2: сильнейшую модель с полностью открытыми весами. Она читает всю таблицу за один проход и по поведению напоминает «обученный k-NN»: и меру похожести строк, и способ комбинировать соседей она вынесла из предобучения, а не получила заданными заранее. Конвейер трёхстадийный:
- Set-трансформер кодирует каждую ячейку в 128-мерный вектор: по столбцам и с учётом целевой переменной.
- Для каждой строки четыре CLS-токена «смотрят» на её признаки и склеиваются в один 512-мерный токен (позиционное кодирование RoPE).
- Двенадцать in-context блоков: каждая тестовая строка внимает только размеченным обучающим строкам, а механизм QASSMax сохраняет «резкость» внимания, когда обучающих строк становится много.
На выходе голова классификации или 999-квантильной регрессии выдаёт по одному распределению вероятностей на каждую тестовую строку. Отличие от классического k-NN принципиальное: соседей ищет и взвешивает не жёсткая формула, а предобученная сеть.

Кто в игре: карта табличных LLM
Семейство табличных foundation-моделей растёт быстро, и игроки узнаваемые:
- TabPFN и наследники, стартап Prior Labs.
- TabICL / TabICLv2: команда SODA из института Inria.
- TabDPT: Layer 6.
- TabFM: Google Research, вышла всего за две недели до публикации разбора.
И тут важная деталь для доверия. Доску TabArena возглавляет именно TabFM от Google, но она вышла без статьи: публикации и описания метода нет. TabICLv2, наоборот, на фронтире «дёшево и точно» среди моделей, которые каждый может скачать и проверить сам. Открытые веса против «модели без статьи»: разница не академическая: проверяемость решает, стоит ли тащить модель в продакшн.
Табличная LLM против XGBoost: сравнение
| Критерий | Foundation-модель | XGBoost и деревья |
|---|---|---|
| Обучение на ваших данных | Не нужно, работает zero-shot | Нужно обучать каждый раз |
| Подбор гиперпараметров | Практически отсутствует | Требуется, часто долгий |
| Скорость получения прогноза | Один прямой проход | Обучение + инференс |
| Большие данные | Ограничения по объёму контекста | Масштабируется хорошо |
| Инференс на CPU и латентность | Обычно требует GPU | Работает на CPU, предсказуемо |
| Интерпретируемость | Ниже | Выше, привычные инструменты |
Как автор перепроверил лидерборд за $2
Теперь обещанная деталь. Автор не поверил доске на слово: он пересчитал скоринг из опубликованных артефактов бенчмарка и заново прогнал TabICLv2 с нуля на своём железе. Условия: 51 датасет, официальный протокол Lite (один train/test-сплит на датасет, ровно те же индексы, что на лидерборде), одна GPU AWS A10G.
Результат сошёлся. Он получил Elo 1559 против официальных 1575, соседние позиции, уверенно внутри бутстрэп-интервалов в 60-86 пунктов. По отдельным задачам 16 значений метрик из 51 совпали до четвёртого знака, медианная относительная разница составила 0,08%, а худший датасет разошёлся на 3,5% это уровень обычного недетерминизма GPU, а не разница в методологии.
Самое показательное: счёт. Весь прогон вместе с настройкой окружения уложился в 2,1 часа GPU-сессии и стоил чуть больше $2 (примерно 170 рублей по текущему курсу). Полная перепроверка отраслевого бенчмарка за цену чашки кофе это и есть новая экономика: не только предсказание, но и его аудит стали дешёвыми.
Где деревья всё ещё выигрывают
Хоронить XGBoost рано. На очень больших выборках табличные LLM упираются в ограничения контекста. Где нужна интерпретируемость: деревья дают привычные инструменты объяснения важности признаков. Где инференс идёт на CPU и критична стабильная низкая латентность, бустинг предсказуем и не требует GPU. На наш взгляд, ближайший год пройдёт не под флагом «замены», а под флагом выбора инструмента под задачу.
Есть и приятный бонус для тех, кому важна приватность. Открытые веса TabICLv2 означают, что модель можно держать и запускать на своём железе, не отдавая данные во внешний сервис, например, на арендованном VPS под вашим контролем. Если поднимаете такой сервер под задачи с чувствительными данными, VPS от Sigma закроет вопрос с приватным окружением.
Что делать аналитику уже сегодня
Начните с малого: возьмите датасет, на котором обычно гоняете бустинг, и прогоните открытую табличную LLM zero-shot, просто чтобы увидеть базовую точность без единого часа на подбор параметров. Дальше решайте по месту.
Что бы вы выбрали для нового табличного проекта прямо сейчас?
Частые вопросы
Табличные LLM правда работают с текстом?
Нет. «LLM» здесь метафора: это трансформеры, но они обрабатывают ячейки, столбцы и строки, а не слова. Общего с языковыми моделями: только механизм in-context learning.
Нужно ли обучать модель на моих данных?
Нет. Вы подаёте размеченные строки в контекст, и модель предсказывает остальные за один проход. То, что раньше называлось обучением, здесь стало инференсом.
Стоит ли уже отказываться от XGBoost?
Не в лоб. Для больших данных, CPU-инференса, низкой латентности и интерпретируемости деревья по-прежнему сильны. Табличные LLM выигрывают на быстрых прототипах и там, где не хочется возиться с гиперпараметрами.
Источники
Towards Data Science, введение в табличные foundation-модели и независимый аудит TabICLv2
На чём вы сейчас гоняете табличные прогнозы, всё ещё бустинг, или уже пробовали что-то из foundation-моделей?
Ответить в комментариях



Пока нет комментариев. Будьте первым!