Мировые модели ИИ: что они умеют симулировать и где предел их возможностей

Технологии Олег Васильевич Клод 13.07.2026 6 мин чтения 128 просмотров
Мировые модели ИИ: что они умеют симулировать и где предел их возможностей

За первые три месяца 2026 года стартапы, занятые так называемыми мировыми моделями ИИ (world models), собрали более 2 миллиардов долларов. Это новая категория искусственного интеллекта, которая пытается не разговаривать, а симулировать физическую реальность, и именно на неё сейчас смещается фокус исследователей, инвесторов и бывших звёзд LLM-лабораторий. По материалу Ars Technica и публикациям 2026 года разбираем, что мировые модели уже умеют симулировать, кто их строит и где проходит предел их возможностей.

Чем мировые модели ИИ отличаются от LLM

Большая языковая модель угадывает следующий токен: слово, кусок кода, знак. Мировая модель предсказывает следующее состояние среды. Что произойдёт с мячом, если его толкнуть; как ляжет тень, если сдвинуть источник света; удержится ли башня из кубиков. Гравитацию, столкновения, освещение и устойчивость объектов модель усваивает из данных, из видео и сенсорных потоков, методом самообучения без разметки, а не через ручные правила.

Разница видна и в подходе к продукту. LLM начинали с интерфейса (чат) и потом искали, куда его применить. В мировых моделях идут наоборот: стартуют с конкретных задач, будь то робототехника, генерация 3D-ассетов или симуляция дорожных ситуаций, а как в итоге будет выглядеть интерфейс, пока непонятно самим разработчикам.

Почему о мировых моделях заговорили именно сейчас

Мировые модели подают как ответ на разочарование в языковых. Ян Лекун, экс-главный ИИ-учёный Meta, называет идею довести LLM до человеческого уровня интеллекта «полной бессмыслицей». Фей-Фей Ли, сооснователь стартапа World Labs, формулирует мягче: сегодняшние LLM «красноречивые, но неопытные, знающие, но не заземлённые», а пространственный интеллект она зовёт «следующим рубежом ИИ». CEO Hugging Face Клем Деланг говорит прямо: «Мы в пузыре LLM, и он может лопнуть в следующем году», оговариваясь, что языковые модели всё же лишь часть большого ИИ.

За материал Ars Technica высказались трое практиков: Винсент Зицманн из MIT, Анастасис Германидис из Runway и Бен Милденхолл из World Labs. Все сходятся в одном: модели научились воспроизводить внешний вид реальности, но её законы пока нет.

Финансовое цунами 2026 года

Деньги заходят в эту область быстрее, чем появляются готовые продукты. Самый громкий раунд у компании AMI Labs (Advanced Machine Intelligence), которую основал Ян Лекун: сид на 1,03 миллиарда долларов при оценке 3,5 миллиарда до вложений, объявлен 9 марта 2026 года. Это крупнейший стартовый раунд в истории Европы. Возглавил компанию Александр ЛеБрюн, среди инвесторов Bezos Expeditions, NVIDIA, Samsung, Toyota Ventures и Temasek, а хабы разместились в Париже, Нью-Йорке, Монреале и Сингапуре.

Технологическая ставка AMI, архитектура JEPA (Joint Embedding Predictive Architecture), предложена Лекуном ещё в 2022 году: предсказание в абстрактном латентном пространстве, а не пиксель в пиксель. ЛеБрюн честно предупреждает: «Это ставка не на продукт, а на парадигму», а сами продукты обещает через «годы, а не кварталы». И он же иронизирует, что через полгода каждая вторая компания назовёт себя «мировой моделью», лишь бы поднять деньги.

World Labs привлекла около миллиарда, Runway 315 миллионов при оценке 5,3 миллиарда. По прогнозу PitchBook, один только сегмент мировых моделей в играх вырастет с 1,2 миллиарда долларов (совокупно за 2022-2025) до 276 миллиардов к 2030 году.

Что мировые модели уже умеют симулировать: кто и что выпустил

Подходы разошлись на несколько школ, и это само по себе показатель незрелости: единой универсальной мировой модели пока нет.

  • Genie 3 от Google DeepMind собирает интерактивные 3D-среды в реальном времени, 720p при 24 кадрах в секунду, держит консистентность «на минуты» и позволяет на лету менять погоду или добавлять объекты. Пока это ограниченный research preview. В феврале 2026-го Waymo адаптировала технологию в собственную Waymo World Model для симуляции редких дорожных ситуаций.
  • Marble от World Labs стал первым коммерчески доступным продуктом этой категории (ноябрь 2025). Генерирует постоянные, скачиваемые 3D-среды из текста, фото, видео и 360-панорам, экспортирует в Gaussian splats и меши, совместим с Unreal Engine и Unity. API открыли в январе 2026, тарифы от бесплатного до примерно 95 долларов в месяц.
  • GWM-1 от Runway: трио специализированных моделей на базе Gen-4.5: Worlds (среды), Avatars (цифровые люди) и Robotics (синтетические данные для обучения роботов, заявлена корреляция 0,95 с реальными результатами).
  • NVIDIA Cosmos: открытые базовые модели, обученные примерно на 20 миллионах часов видео, более 2 миллионов скачиваний; версия Cosmos 3 вышла 1 июня 2026.

Открытая линейка стоит отдельного упоминания: помимо Cosmos есть Meta V-JEPA 2 и китайская Tencent HunyuanWorld. Для тех, кто ценит независимость от закрытых платформ, это шанс запускать генерацию миров локально, без привязки к чужому облаку.

Скриншот генерации 3D-среды в Marble от World Labs
Marble от World Labs генерирует постоянные 3D-среды с экспортом в Unreal и Unity.

Где проходит предел возможностей мировых моделей

Главный отрезвляющий факт: модели плохо понимают физику, которую так убедительно рисуют. Бенчмарк VideoScience-Bench (Hao AI Lab, UCSD, февраль 2026) показал, что даже лучшие модели регулярно «галлюцинируют» физику. Видео выглядит идеально, а законы реальности не соблюдаются. Вердикт авторов жёсткий: это «высокофотореалистичный генератор галлюцинаций, а не надёжный симулятор мира».

Второй бенчмарк, PhysicsMind, добавляет деталей: и визуально-языковые, и видеогенеративные модели опираются на поверхностные признаки картинки и нарушают базовые ограничения по балансу, крутящему моменту и инерции. Настоящего физического понимания не возникает.

Долгий горизонт и цена инференса

Дальше идёт проблема долгого горизонта. На длинных траекториях объекты исчезают, физика ломается, память среды коротка. Прибавьте прожорливость: инференс мировых моделей в 8-32 раза дороже, чем у LLM. И общепринятых бенчмарков «понимания мира» нет, мерить прогресс толком нечем.

Размытость самого термина

Размыт и сам термин. Фей-Фей Ли признаёт, что ещё в 2024-м определять «мировую модель» было проще. Сегодня под одним словом понимают интерактивное видео (Runway, DeepMind, Cosmos), пространственный 3D-объект (World Labs) и латентную JEPA-архитектуру (AMI, Meta), а это вещи с очень разной логикой.

Зачем мировые модели ИИ нужны вам

Практический смысл ближе, чем кажется. Уже сейчас можно генерировать игровые уровни и VR-сцены из текстового описания, готовить синтетические данные для обучения роботов и беспилотников, собирать 3D-ассеты без ручного моделирования. Открытые модели вроде Cosmos и HunyuanWorld позволяют делать это на своём железе. А спор о том, ведут ли мировые модели к общему искусственному интеллекту или остаются отдельной прикладной ветвью, пока открыт: Демис Хассабис и Фей-Фей Ли считают их необходимым шагом к AGI, критики видят самостоятельную нишу.

Если планируете экспериментировать с генерацией сред, начните с Marble или открытого Cosmos. И держите в голове главное ограничение: перед вами пока рендерер внешнего вида реальности, а не её симулятор.

Частые вопросы

Чем мировая модель отличается от обычной нейросети для генерации видео?

Видеомодель делает красивый ролик. Мировая модель претендует на предсказание причинно-следственных связей и физики среды, а не только правдоподобной картинки. На практике граница размыта: многие мировые модели построены поверх видеогенеративных.

Можно ли уже использовать мировые модели в реальных проектах?

Да, ограниченно. Marble генерирует экспортируемые 3D-среды для Unreal и Unity, Runway Robotics даёт синтетические данные для обучения роботов, Waymo симулирует редкие дорожные сценарии. Но полагаться на физическую точность вывода пока рискованно.

Есть ли открытые мировые модели?

Есть: NVIDIA Cosmos (более 2 миллионов скачиваний), Meta V-JEPA 2 и Tencent HunyuanWorld. Их можно запускать вне закрытых платформ.

Источники

Ars Technica, обзор мировых моделей: обещания и пределы

Мозговые волны как топливо для роботов: как в Калифорнии учат физический ИИ читать мысли оператора
Читать следующую Мозговые волны как топливо для роботов: как в Калифорнии учат физический ИИ читать мысли оператора

Комментарии

0
?

Пока нет комментариев. Будьте первым!