AMD и Cerebras идут против Nvidia: как связка GPU и «вафли» меняет ИИ-инференс

AMD и Cerebras объединяются против Nvidia на рынке ИИ-чипов, и это меняет расстановку сил в ИИ-инференсе. 23 июля 2026 года на кейноуте Лизы Су «Advancing AI» AMD объявила о партнёрстве с Cerebras Systems: две компании строят «дезагрегированную вычислительную платформу», где GPU AMD Instinct работают в паре с вафля-масштабными ускорителями Cerebras. Цель: сверхнизкая задержка инференса для агентских нагрузок. По логике «враг моего врага» этот союз бьёт прямо в связку Nvidia и Groq. Ниже цифра, из-за которой две тысячи чипов у Nvidia превращаются у AMD в пару десятков.
Враг моего врага: зачем AMD понадобился Cerebras
У AMD есть сильные GPU для обучения моделей, но в линейке зиял пробел на самом горячем сейчас участке, быстрой генерации токенов. Nvidia этот пробел закрыла грубо: в декабре 2025-го она заплатила 20 миллиардов долларов за acqui-hire стартапа Groq, чтобы получить его технологию Language Processing Unit. AMD пошла другим путём и договорилась с чужим лидером по скорости выдачи.
Эндрю Фельдман, гендиректор и сооснователь Cerebras, сформулировал смысл союза прямо: «С Instinct и стойкой Helios вы получаете лидера по производительности и объёму памяти. Соединяете это с нашим Wafer Scale Engine, лидером по SRAM и пропускной способности памяти, и эта комбинация даёт решение, которому нет равных». Тот же Фельдман раньше язвительно называл Nvidia «всего лишь торговцем оружием в ИИ-гонке», так что мотивация у него личная.
Prefill на GPU, decode на вафле: как устроен ИИ-инференс
Вся идея строится на разделении двух фаз работы языковой модели. Обработка промпта (prefill) упирается в вычисления, здесь GPU в своей стихии. Генерация ответа по одному токену за раз (decode) упирается в скорость памяти. Разносить эти фазы на разное железо, растущий тренд в инференс-инфраструктуре, и AMD с Cerebras доводят его до уровня готового продукта.
В их схеме тяжёлый prefill считают GPU AMD Instinct, а память-интенсивный decode отдают на Wafer Scale Engine. Так система держит высокую интерактивность без падения пропускной способности и без роста стоимости. Для ИИ-агентов, которые делают десятки последовательных вызовов модели подряд, задержка на каждый токен критична, отсюда и гонка за «токены на ватт».
Лиза Су описала это как часть более широкой стратегии: «Есть много способов сделать ускорение под конкретную нагрузку, и у Cerebras очень интересная технология. Она отлично работает с Helios». И добавила: «Можете ожидать, что дальше мы будем делать больше дезагрегации нагрузок».
SRAM против HBM: где GPU проигрывают в выдаче
Главное техническое отличие Cerebras: отказ от привычной памяти HBM. Вместо неё WSE использует встроенную (on-chip) SRAM, которая на порядки быстрее. Поэтому Cerebras стал одним из самых быстрых провайдеров инференса в мире с типичной скоростью 2000+ токенов в секунду.
У SRAM есть очевидный минус: малая ёмкость на чип. Но вафля-масштабная конструкция WSE решает это грубой силой: одна пластина несёт кратно больше SRAM, чем отдельный чип-ускоритель. Совместное решение AMD и Cerebras обещает прирост до 5x по числу токенов в секунду на каждый потреблённый ватт. Конкретных цифр стороны не раскрыли, но порядок заявлен именно такой.
20 миллиардов за Groq и ответ парой десятков чипов
А вот и обещанная цифра. Чтобы обслуживать модель с триллионом параметров уровня Kimi K2.5, связке Nvidia + Groq требуется около 2000 LPU. Той же нагрузке у AMD + Cerebras хватает «максимум нескольких десятков» WSE. Разница в той самой вафле: там, где Groq ставит тысячи отдельных чипов, Cerebras обходится десятками пластин с огромным запасом быстрой памяти.
| Параметр | Nvidia + Groq | AMD + Cerebras |
|---|---|---|
| Тип ускорителя выдачи | Groq LPU | Wafer Scale Engine |
| Память для decode | HBM / DRAM-подход | on-chip SRAM |
| Чипов на модель ~1 трлн параметров | ~2000 | несколько десятков |
| Стоечная платформа | Vera Rubin | Helios |
Cerebras занимает ту же нишу, что и Groq 3 LPU, показанные вместе со стоечными системами Nvidia Vera Rubin на GTC в марте 2026-го. Конкуренция окончательно переехала с уровня отдельных чипов на уровень целых стоек: Helios против Vera Rubin.
Что это значит для ИИ-инфраструктуры
Рынок ИИ-инференса перестал быть монополией на одном подходе. Помимо Groq (теперь под Nvidia), за удешевление и ускорение выдачи токенов бьются SambaNova, сама Cerebras и Qualcomm со своей заявкой «спрятать вычисления под DRAM». Дезагрегация, когда каждую фазу вычислений отдают наиболее подходящему железу, становится нормой.
Что дальше у AMD и Cerebras
Самое интересное здесь не сам союз. AMD обронила фразу про «открытую экосистему» и прямо намекнула, что это «может быть не последняя сделка с этим стартапом». Совместное решение появится в Cerebras Cloud до конца 2026 года. Если вам важен быстрый и стабильный доступ к таким сервисам из России, держите под рукой Sigma: многие облачные ИИ-платформы у нас открываются только через VPN.
На чью связку железа вы бы поставили в гонке ИИ-инференса?
Источники
The Register, о партнёрстве AMD и Cerebras против Groq LPU от Nvidia
За чьим железом вы следите в ИИ-гонке: и ставите ли вообще на кого-то, кроме Nvidia?
Ответить в комментариях



Пока нет комментариев. Будьте первым!