Nvidia Vera Rubin: гонка за «токенами на ватт» и почему это новая валюта ИИ-фабрик

Технологии Олег Васильевич Клод 21.07.2026 5 мин чтения 8 просмотров
Nvidia Vera Rubin: гонка за «токенами на ватт» и почему это новая валюта ИИ-фабрик

Nvidia 21 июля 2026 года показала журналистам новую вычислительную платформу Vera Rubin и придумала под неё лозунг «tokenmaxxing»: выжимать из каждого ватта электричества максимум сгенерированных токенов. По первым замерам Nvidia, Vera Rubin выдаёт до 10 раз больше токенов на ватт, чем прошлое поколение GB200 NVL72. Но цифры производительности тут вторичны. Куда любопытнее экономический сюжет, который Nvidia проговаривает почти открыто: цена токена падает, и компания на это рассчитывает. К этой цифре мы вернёмся в конце.

Брифинг прошёл в закрытой мини-лаборатории Nvidia, крошечном дата-центре в жилом квартале Саннивейла в Кремниевой долине. Адрес журналистов просили не раскрывать. Одна из четырёх таких площадок компании, где обкатывают железо перед выходом в большие «ИИ-фабрики».

Токены на ватт: почему это стало метрикой выручки

Логика Nvidia простая. Если ИИ-сервис зарабатывает на продаже токенов (а именно в токенах тарифицируются ответы моделей вроде ChatGPT), то и железо надо оптимизировать под выпуск токенов, а не под абстрактную производительность. Иан Бак, глава подразделения hyperscale и HPC в Nvidia, сформулировал это так:

«Каждая ИИ-фабрика ограничена по мощности… важнейшая метрика, производительность на фиксированный ватт».

Дальше идёт арифметика бизнеса. Инфраструктуру арендуют «за доллары в час», а выручку она приносит «прибыльными токенами, на сотни долларов в час». Отсюда термин Nvidia «ИИ-фабрика» (AI Factory): дата-центр, где сырьё это электроэнергия, а продукт это токены. Мощность в мегаваттах становится потолком и новой валютой: сколько токенов ты успел сгенерировать на выделенный ватт, столько и заработал.

Для России этот сдвиг пока абстрактен: крупных ИИ-фабрик такого масштаба у нас нет. Но метрика «токены на ватт» объясняет, почему подписки на зарубежные нейросети стоят денег и почему провайдеры бьются за каждый процент эффективности.

Шесть чипов Nvidia Vera Rubin: от Vera CPU до Spectrum-6

Платформа Vera Rubin это связка из шести специализированных чипов, каждый под свою роль в стойке.

ЧипРоль
Vera CPUЦентральный процессор на ядрах Olympus Core
Rubin GPUОсновной ускоритель вычислений
NVLink 6Коммутатор для связи GPU между собой
ConnectX-9Сетевой адаптер
BlueField-4DPU, разгрузка сетевых и служебных задач
Spectrum-6Ethernet-коммутатор

Платформу анонсировали ещё на Computex 2024, а детали раскрыли на CES в январе. Сейчас Nvidia впервые показала её в работе.

Вычислительный лоток платформы Nvidia Vera Rubin

Ставка на быстрое ядро, а не на число ядер

Отдельно Nvidia напирает на Vera CPU с ядрами Olympus Core. По заявлениям компании, процессор ускоряет ИИ-агентов вдвое, даёт тройную пропускную способность «ядро-ядро» и на 40% ниже задержку, во многом за счёт памяти LPDDR5X. Философия идёт вразрез с привычной гонкой за количеством ядер: для агентных задач быстрое ядро важнее, чем их число.

Почему так? Агентные нагрузки это устойчивый инференс с низкой задержкой на множестве шагов рассуждения, работа с длинным контекстом, большой объём KV-кэша и масштабирование модели на связанные домены GPU. Каждый шаг рассуждения ждёт предыдущего, и скорость отдельного ядра решает больше, чем параллелизм.

10× к GB200: что именно замерили на DeepSeek-R1

Десятикратный рост токенов на ватт получен не на синтетике. По первичным результатам облачного провайдера CoreWeave, замер шёл на модели DeepSeek-R1. Выбор понятен: это reasoning-модель с длинными цепочками рассуждений, ровно та нагрузка, под которую Nvidia и продаёт Vera Rubin. Точка отсчёта во всех сравнениях «в N раз» это GB200 NVL72, предыдущее поколение Grace Blackwell со стойкой на 72 GPU.

Оговорка: все перформанс-показатели это заявления самой Nvidia (формулировка «Nvidia claims»). Независимых тестов на момент брифинга нет, так что к «десятке» стоит относиться как к маркетинговому максимуму, а не гарантии.

Сборка стойки Vera Rubin за минуту вместо полутора часов

Есть цифра, которая впечатляет и без бенчмарков. Вычислительный лоток (compute tray) стойки Vera Rubin NVL72 с автоматизированной сборкой собирается за одну минуту против примерно 90 минут у GB200, «улучшение в 90 раз», по словам Эндрю Белла, старшего вице-президента по аппаратной инженерии. Это скорость развёртывания плюс меньше ручного труда и ошибок при монтаже тысяч стоек.

Стойка Nvidia Vera Rubin NVL72 в лаборатории

Дешевеющий токен: цифра, которую заметили не все

Теперь обещанное. За всей презентацией эффективности стоит признание, о котором Nvidia говорит спокойно: по мере роста предложения токенов, благодаря более эффективному железу и конкуренции ИИ-провайдеров, цена одного токена падает. Плохая новость для тех, кто вкладывает миллиарды в дата-центры?

Расчёт Nvidia и передовых ИИ-лабораторий в другом: при удешевлении спрос на токены будет расти быстрее, чем падает цена. Это классический парадокс Джевонса: чем дешевле ресурс, тем больше его потребляют в сумме. Дешевле токен, больше запросов, агентов, генераций, а значит и выручки в абсолюте. Поэтому «токены на ватт» подаются как экономическая метрика, а не только техническая: кто выжимает больше токенов на ватт, при падающей цене всё равно остаётся в плюсе.

Обратная сторона бума проявилась через день после брифинга: голландские активисты забросали дата-центр, обслуживающий нагрузки Microsoft, шарами с химикатами. Протест против климатических и политических последствий ИИ. Гонка за токенами упирается в мегаватты, а мегаватты в реальную инфраструктуру, воду и электросети, которые кто-то видит из своего окна.

Если вам важен стабильный доступ к зарубежным ИИ-сервисам вроде ChatGPT из России, это удобно решается через Sigma.

Опрос 0 голос.

Что вас больше цепляет в Vera Rubin?

Что платформа Nvidia Vera Rubin значит для вас

Прямо сейчас Vera Rubin это про будущие цены на ИИ-подписки и скорость ответов моделей, которыми вы пользуетесь. Если ставка Nvidia сработает, токены продолжат дешеветь, а лимиты в чат-ботах расти. Если нет, за эффективность железа заплатит подписчик.

Источники

The Register, репортаж с брифинга Nvidia о платформе Vera Rubin и «tokenmaxxing»

Вопрос читателям

А вы уже считали, сколько в месяц уходит на подписки с ИИ, ChatGPT, нейросети, генерации? Округлите честно.

Ответить в комментариях
Аналоговые чипы возвращаются: спасут ли они ИИ от энергетического тупика, и переживут ли собственный шум
Читать следующую Аналоговые чипы возвращаются: спасут ли они ИИ от энергетического тупика, и переживут ли собственный шум

Комментарии

0
?

Пока нет комментариев. Будьте первым!