Разработчик запустил нейросеть на микроконтроллере за $10: как ужать LLM в 2 мегабайта

ИИ Олег Васильевич Клод 05.08.2026 5 мин чтения 1 просмотров
Разработчик запустил нейросеть на микроконтроллере за $10: как ужать LLM в 2 мегабайта

Разработчик под ником SlvDev запустил полноценную языковую модель (LLM) на микроконтроллере ESP32-S3, чипе дешевле $10, который обычно управляет датчиками и лампочками в умном доме. Нейросеть заработала со скоростью 9,88 токена в секунду, то есть выдаёт текст быстрее, чем его успевает читать средний человек. Чтобы запустить LLM на микроконтроллере, модель весом около 60 мегабайт пришлось ужать до примерно 2 мегабайт рабочей памяти. Каким фокусом, разберём ниже. О кейсе рассказал 4 августа 2026 года Тобиас Манн в The Register.

Практической пользы тут, если честно, почти ноль. Автор материала сам иронизирует, что кроме «простой глупой гордости» смысла немного. Но за этим трюком стоят инженерные приёмы, которые уже сегодня заставляют серьёзный ИИ работать прямо на смартфоне: без облака и без отправки ваших данных на чужие серверы.

LLM на микроконтроллере за цену чашки кофе: что за железо

ESP32-S3 выпускает китайская компания Espressif Systems. Его ставят в умные розетки, метеостанции, самодельную электронику и IoT-датчики. Это копеечный контроллер со скромной памятью: 520 КБ SRAM плюс 8 МБ PSRAM (в некоторых конфигурациях около 8,5 МБ рабочей памяти) и опционально до 16 МБ флеш-памяти. Для сравнения: этой памяти не хватит даже на пару фотографий с телефона.

Именно поэтому кейс и выглядит абсурдно-впечатляющим. Языковые модели привыкли ассоциировать со стойками серверов и счетами за электричество, а тут плата, которую можно купить за стоимость большого капучино.

Почему в контроллер влезла именно эта модель

Секрет в выборе модели. SlvDev взял TinyStories, нейросеть на 28,9 млн параметров из Microsoft Research. Это примерно в 10 000 раз меньше, чем крупная современная LLM.

TinyStories, исследовательский проект Ronen Eldan и Yuanzhi Li, задумывался, чтобы доказать: даже крошечная модель, обученная на простых синтетических детских историях, способна выдавать связный, грамматически правильный текст. Модель заранее заточена быть маленькой и при этом осмысленной, идеальный кандидат, чтобы влезть на слабое железо.

Но и 28,9 млн параметров для ESP32 много. В стандартной 16-битной точности веса модели занимают около 60 МБ. Столько памяти у чипа нет.

60 мегабайт в 2 мегабайта: анатомия сжатия LLM

Чтобы уместить модель, разработчик применил два приёма.

Первый приём, квантизация, работает как сжатие фотографии в JPEG: часть точности уходит ради размера. Веса модели хранятся в 8 или даже 4 битах вместо 16. Переход с высокой точности на низкую (условно FP16 → INT8 → INT4) урезал память примерно на 75%, с ~60 МБ до 14,9 МБ. Платим небольшой потерей точности, для генерации простых историй некритичной.

Второй приём, Per-Layer Embedding (PLE), разработчик позаимствовал у моделей Google Gemma. PLE выгружает бóльшую часть весов (около 25 млн параметров, примерно 12 МБ) во флеш-память почти без потерь в производительности.

Выгрузка весов в медленную память не новость: так запускают даже гигантов вроде DeepSeek V3, сбрасывая веса на NVMe-накопитель. Обычно это убивает скорость, до секунд или даже минут на один токен. PLE устроен иначе: он обращается к выгруженным весам редко, поэтому медленная флеш-память не тормозит вывод.

В оперативной памяти остаётся держать всего около 2 МБ. В PSRAM живут выходная «голова», эмбеддинги и KV-кэш, а вычисления активаций укладываются в скромные 520 КБ SRAM. Итог: 9,88 токена в секунду на чипе за $10.

Иллюстрация к материалу о запуске нейросети на микроконтроллере
Тот самый кейс с миниатюрной моделью на копеечном чипе. Источник: The Register

Что эта модель реально умеет (и чего не умеет)

TinyStories умеет одно: генерировать короткие связные истории. Чат-бота уровня ChatGPT, генератор кода или ИИ-агента на ней не собрать.

У проекта есть и вторая модель, Barista. Она отвечает на вопросы вдвое быстрее, но только про эспрессо и кофе. Для чего-то серьёзнее микроконтроллера не хватит: нужен хотя бы Raspberry Pi или смартфон.

Процесс SlvDev задокументировал на GitHub и показал на YouTube-канале Better Stack, так что повторить эксперимент может любой желающий с платой и терпением.

От игрушки к смартфону: те же приёмы в Google Gemma

Вот где «глупая гордость» превращается в практику. Ровно те же квантизацию и PLE использует модель Google Gemma 4-E2B-it, запущенная в апреле 2026 года. Она вмещает vision-language модель на 5,1 млрд параметров чуть больше чем в 1 ГБ памяти при 4-битных весах.

Разница в масштабе огромная, а принцип один и тот же. Эти техники позволяют ИИ работать прямо на телефоне, не отправляя каждый ваш запрос на сервер. Эксперимент с запуском LLM на микроконтроллере ESP32 доказывает: потолок «слабого железа» выше, чем принято думать.

Почему это про приватность и доступ

Для нашей аудитории тут главное идея локального ИИ (edge-AI): модель считает прямо на устройстве, а не в облаке. У этого три следствия, и в российских реалиях они важны.

  • Данные не покидают устройство: передавать их «наружу» физически некому, а значит, нечего утекать.
  • Работа полностью офлайн, без зависимости от зарубежных сервисов, которые могут заблокировать или сами закрывают доступ из России.
  • Независимость от чужой инфраструктуры: модель не отключат по ту сторону границы одним щелчком.

На наш взгляд, именно в этом настоящая ценность истории. Пока крупные модели живут в облаках зарубежных компаний, любой сбой, санкция или блокировка оставляют пользователя ни с чем. Локальный ИИ снимает этот риск в принципе. А если доступ к облачным ИИ-сервисам всё же нужен, обойти блокировки помогает Sigma.

Опрос 0 голос.

Локальный ИИ на своём устройстве — это для вас про что?

Коротко: цифры кейса

ПараметрЗначение
ЧипESP32-S3, дешевле $10
Память чипа520 КБ SRAM + 8 МБ PSRAM, до 16 МБ флеш
МодельTinyStories, 28,9 млн параметров
Вес в FP16~60 МБ
После квантизации14,9 МБ (−75%)
В оперативной памяти~2 МБ (остальное во флеш через PLE)
Скорость9,88 токена/с

Частые вопросы

Можно ли поговорить с такой моделью, как с ChatGPT?

Нет. TinyStories генерирует только короткие истории, а модель Barista отвечает лишь на вопросы про кофе. Для полноценного диалога нужна модель на несколько миллиардов параметров и хотя бы смартфон.

Что такое квантизация простыми словами?

Это снижение точности хранения весов модели с 16 бит до 8 или 4. Аналогия та же, сжатие фото в JPEG: размер падает в несколько раз ценой небольшой потери качества. В этом кейсе квантизация урезала память на 75%.

Зачем вообще запускать LLM на таком слабом железе?

Прямой пользы у эксперимента почти нет. Но приёмы сжатия масштабируются: те же квантизация и PLE позволяют запускать модели на 5 млрд параметров на смартфоне в пределах 1 ГБ памяти, то есть держать ИИ локально и офлайн.

Источники

The Register, о запуске языковой модели на микроконтроллере ESP32-S3 за $10

Вопрос читателям

А вы бы доверили ИИ-помощнику работать целиком офлайн, без единого запроса в облако?

Ответить в комментариях
Мозговые волны как топливо для роботов: как в Калифорнии учат физический ИИ читать мысли оператора
Читать следующую Мозговые волны как топливо для роботов: как в Калифорнии учат физический ИИ читать мысли оператора

Комментарии

0
?

Пока нет комментариев. Будьте первым!