Thinking Machines выпустила Inkling: открытую модель на 975 млрд параметров

Нейросети Олег Васильевич Клод 16.07.2026 4 мин чтения 10 просмотров
Thinking Machines выпустила Inkling: открытую модель на 975 млрд параметров

Лаборатория Thinking Machines Lab, основанная в начале 2025 года бывшим техническим директором OpenAI Мирой Мурати, 16 июля 2026 года выпустила свою первую открытую модель на 975 млрд параметров под кодовым названием Inkling. Это фронтир-модель под свободной лицензией Apache 2.0, первая по-настоящему открытая американская LLM, готовая конкурировать с китайскими открытыми моделями и закрытыми решениями OpenAI.

The Register вынесло в заголовок противопоставление: Мурати сделала то, на что не пошёл Сэм Альтман. OpenAI годами держит свои сильнейшие модели закрытыми, а её лаборатория выложила крупнейшую американскую модель с открытыми весами в общий доступ. Скачать её можно на Hugging Face, а тонкую настройку разрешает Apache 2.0, одна из самых либеральных лицензий с полной коммерческой свободой.

Inkling: открытая 975B-модель и очень много железа

Inkling, крупнейшая на сегодня американская модель с открытыми весами. Расплата за размер, требования к оборудованию. Для нативной 16-битной точности нужно более 2 ТБ памяти GPU: это примерно восемь ускорителей Nvidia B300 или шестнадцать H200. Домашним энтузиастам сюда путь закрыт.

Для тех, у кого железа поменьше, есть квантованная версия в формате NVFP4, она работает на вдвое меньшем числе карт. Обучали модель на системах Nvidia GB300 NVL72, скормив ей 45 трлн токенов текста, изображений, аудио и видео. Значит, Inkling мультимодальна, а её контекстное окно доходит до 1 млн токенов, этого хватает, чтобы держать в памяти крупную кодовую базу целиком.

MoE-архитектура: 975 млрд, но работают 41

Inkling построена по схеме Mixture-of-Experts (смесь экспертов), вдохновлённой DeepSeek-V3, но обучена с нуля. Внутри 256 маршрутизируемых экспертов и ещё два общих. На генерацию каждого токена задействуются лишь шесть экспертов, около 41 млрд активных параметров из общих 975.

Поэтому огромная модель не тормозит: по скорости генерации она сопоставима с DeepSeek V4 на том же оборудовании. Вы платите памятью за размер, но не платите скоростью за каждый ответ.

Reasoning без лишних трат

Это reasoning-модель: её обучили через обучение с подкреплением использовать «цепочку рассуждений» перед ответом. Разработчики упирают на экономность, модель не растягивает размышления зря. На тесте Terminal Bench 2.1 она показала результат на уровне Nvidia Nemotron 3 Ultra (550 млрд параметров, до этого крупнейшая американская открытая модель), но потратила примерно втрое меньше токенов.

Момент, который стоит держать в голове разработчикам приложений: «думающие» токены тарифицируются как обычные. Чем дольше модель рассуждает, тем выше счёт. Экономность Inkling здесь не абстрактная цифра из презентации, а прямая экономия для тех, кто строит на модели продукт.

Где Inkling среди конкурентов: китайские LLM и OpenAI

По бенчмаркам модель конкурентна с китайскими открытыми LLM: DeepSeek V4, GLM 5.2, Kimi K2.6. При этом она уступает проприетарным Claude от Anthropic и GPT от OpenAI. Автор The Register честно предупреждает: к бенчмаркам стоит относиться с осторожностью, реальные задачи часто расходятся с цифрами таблиц.

Thinking Machines выпустила Inkling: открытую модель на 975 млрд параметров

Геополитический контекст тут важнее сухих процентов. До Inkling выбор фронтир-моделей с открытыми весами был почти полностью за китайскими компаниями. Сильная американская альтернатива под Apache 2.0 меняет расклад для всех, кто по разным причинам не хочет строить инфраструктуру на китайских моделях или на закрытых решениях OpenAI.

Держите в уме нюанс терминологии: открытые веса не равны полностью открытому исходному коду и данным. Вы получаете саму модель и право её дообучать и использовать коммерчески, но не рецепт её создания целиком.

Экосистема и что дальше

С момента запуска Inkling доступна через платформу Tinker (собственный API и инструменты файнтюнинга Thinking Machines), а также через интеграции с TogetherAI, Fireworks, Modal, Databricks и Baseten. Из движков инференса поддерживаются vLLM, SGLang, Miles, TokenSpeed и Llama.cpp.

Любопытная деталь: заявлено, что модель способна писать собственные скрипты дообучения, обучать себя новым навыкам и оценивать свои способности. Насколько это работает на практике, покажет использование.

Inkling-Small и происхождение названия

Inkling, только первая в линейке. Уже анонсирована Inkling-Small: MoE на 276 млрд параметров (12 млрд активных), заточенная под сценарии с приоритетом низкой задержки. Её веса выложат после завершения тестирования. Кстати, само название Thinking Machines перекликается с вымышленным производителем суперкомпьютеров из «Парка Юрского периода» 1993 года.

Что открытая модель Inkling значит для пользователей из России и СНГ

Для практика из региона главное, доступность инструментов. Hugging Face, зарубежные API вроде TogetherAI, Fireworks и Baseten, да и большинство AI-сервисов из России нередко открываются только через VPN или собственный VPS за границей. Если вы планируете скачать веса или подключиться к API Inkling, стабильный доступ решает больше, чем размер модели. Обойти блокировки и получить приватный канал к таким сервисам помогает Sigma.

Источники

The Register, о выходе открытой модели Inkling от Thinking Machines

Почему компании пересматривают отношение к ИИ: как счета за токены отрезвили бизнес
Читать следующую Почему компании пересматривают отношение к ИИ: как счета за токены отрезвили бизнес

Комментарии

0
?

Пока нет комментариев. Будьте первым!