Raspberry Pi расширяет возможности периферийного ИИ с LiteRT и Gemma
Компания Raspberry Pi совместно с Google продолжает развивать возможности локального искусственного интеллекта на одноплатных компьютерах. Одним из последних шагов в этом направлении стала оптимизация LiteRT для Raspberry Pi — среды выполнения, предназначенной для запуска моделей машинного обучения непосредственно на устройстве.
Главная идея заключается в том, чтобы выполнять задачи искусственного интеллекта без постоянного обращения к облачным сервисам. Такой подход позволяет создавать автономных роботов, интеллектуальные камеры, голосовых помощников и другие системы, способные анализировать окружающую среду и принимать решения локально. Среди преимуществ периферийного ИИ — низкая задержка, независимость от интернет-соединения и возможность хранить обрабатываемые данные непосредственно на устройстве.
LiteRT на Raspberry Pi
LiteRT представляет собой разработанную Google среду для выполнения моделей машинного обучения непосредственно на конечных устройствах. Она поддерживает как относительно простые ML-модели, так и современные большие языковые модели.
На Raspberry Pi LiteRT способен задействовать вычислительные возможности центрального и графического процессоров. Оптимизация выполнения и расхода оперативной памяти особенно важна для одноплатных компьютеров, где аппаратные ресурсы значительно ограниченнее, чем на настольных ПК или серверах.
Одним из основных примеров использования LiteRT стала работа с семейством открытых моделей Gemma от Google. В качестве демонстрационной платформы разработчики использовали Raspberry Pi 5 и небольшого робота Reachy Mini. Компьютер локально обрабатывает изображение и речь, запускает языковую модель и формирует реакцию робота без необходимости передавать информацию в облако.
Какие модели Gemma подходят для Raspberry Pi
Семейство Gemma включает несколько моделей, рассчитанных на разные задачи и доступные аппаратные ресурсы.
Gemma 3 270M представляет собой компактную базовую модель, подходящую для последующей адаптации под конкретные задачи. Ее можно использовать, например, для анализа тональности текста или извлечения сущностей.
EmbeddingGemma 300M предназначена для создания текстовых эмбеддингов. Такая модель может применяться для семантического поиска, классификации информации и построения систем RAG.
Gemma 3 1B является более крупной многоязычной моделью. Она рассчитана на генерацию текста, создание кратких изложений и выполнение различных задач, связанных с локальной обработкой естественного языка.
Более производительные Gemma 4 E2B и Gemma 4 E4B ориентированы на периферийные устройства с ограниченным объемом памяти. E2B подходит в том числе для постоянной обработки текста, изображения и аудио, тогда как E4B рассчитана на более сложные задачи рассуждения и многоэтапного планирования.
Производительность Gemma на Raspberry Pi 5
Для запуска языковых моделей используется LiteRT-LM — специализированный слой поверх LiteRT. Для ускорения вычислений на CPU применяется XNNPACK.
В опубликованных Raspberry Pi тестах Gemma 4 E2B запускалась на Raspberry Pi 5 с 8 ГБ оперативной памяти. При использовании четырех потоков процессора LiteRT-LM обеспечил скорость предварительной обработки около 99 токенов в секунду, а генерации — около 9 токенов в секунду. Пиковое потребление памяти составило примерно 1432 МБ.
Для сравнения, приведенный в тестировании вариант llama.cpp показал 24 токена в секунду при предварительной обработке и 4 токена в секунду при генерации, потребляя при этом около 4406 МБ памяти.
Благодаря особенностям токенизатора Gemma 4 E2B итоговая скорость генерации в демонстрации Reachy Mini достигала примерно 27,3 символа в секунду, что разработчики сопоставляют примерно с 300 словами в минуту.
Еще более компактная Gemma 3 270M демонстрирует значительно большую скорость. В тестах LiteRT-LM она достигала примерно 433 токенов в секунду на этапе prefill и около 23 токенов в секунду при генерации.
Использование CPU и GPU
Raspberry Pi 5 оснащен четырехъядерным процессором Arm Cortex-A76 и встроенной графикой Broadcom VideoCore VII. Согласно данным Raspberry Pi, производительность CPU достигает примерно 153,6 GFLOPS при вычислениях FP32 и до 2 TOPS при INT8. Для GPU заявлены пиковые показатели около 76,8 GFLOPS FP32 и 0,24 TOPS INT8.
Несмотря на то что центральный процессор обладает большей вычислительной производительностью, использование GPU позволяет распределять нагрузку между разными компонентами системы.
Например, графический процессор может постоянно выполнять модель компьютерного зрения, тогда как CPU остается доступным для языковой модели, управления программой и других вычислительно интенсивных операций.
Для этого в LiteRT на Raspberry Pi 5 реализовано выполнение моделей на GPU через WebGPU с использованием Vulkan. Поддерживаются различные модели компьютерного зрения, обработки аудио и создания эмбеддингов, включая MediaPipe, Ultralytics YOLO и Moonshine.
При этом GPU не обязательно оказывается быстрее CPU. В опубликованных тестах Raspberry Pi модель YOLO26n выполнялась примерно за 101 мс на CPU и за 376 мс на GPU. Однако смысл переноса вычислений на графику заключается не только в скорости конкретной модели, но и в возможности освободить процессор для параллельного выполнения других задач.
Робот Reachy Mini как пример локального ИИ
Практическую работу новой системы Raspberry Pi и Google продемонстрировали на роботе Reachy Mini. Вся обработка выполняется непосредственно на Raspberry Pi 5.
Архитектура системы разделена на несколько параллельно работающих компонентов:
-
модель YOLO непрерывно анализирует изображение с камеры при помощи GPU;
-
Moonshine выполняет распознавание речи на CPU;
-
Gemma 4 E2B получает распознанный текст и информацию от системы компьютерного зрения, после чего формирует ответ и необходимые действия;
-
система синтеза речи преобразует полученный текст в звук.
В результате робот способен видеть окружающие объекты, воспринимать речь человека, анализировать полученную информацию, отвечать и выполнять физические действия без отправки данных во внешние облачные сервисы.
LiteRT CLI упрощает работу с моделями
Для разработчиков Google предлагает LiteRT CLI — набор инструментов командной строки, объединяющий основные операции по работе с моделями.
Через него можно выполнять конвертацию и квантование моделей, проводить тесты производительности и запускать inference. Это избавляет разработчика от необходимости самостоятельно объединять несколько отдельных библиотек и инструментов.
Особое внимание уделяется размеру самого программного окружения. Версия LiteRT CLI с поддержкой запуска LLM требует загрузки примерно 25 МБ. Для сравнения, в статье Raspberry Pi указывается размер Ollama около 1,44 ГБ. Разница связана в том числе с модульной архитектурой LiteRT: необходимые компоненты устанавливаются в зависимости от конкретной задачи и используемого оборудования.
Запуск первой модели
Установить LiteRT CLI на Raspberry Pi 5 можно через Python:
pip install litert-cli
После этого разработчик может загрузить совместимую модель из сообщества LiteRT на Hugging Face и запустить ее непосредственно на Raspberry Pi.
Таким образом, для экспериментов с локальными языковыми моделями больше не обязательно самостоятельно настраивать сложный набор библиотек и зависимостей. LiteRT предоставляет единый инструментарий для подготовки, тестирования и выполнения моделей.
Следующий этап — Raspberry Pi AI HAT
Развитие LiteRT на Raspberry Pi не ограничится использованием встроенных CPU и GPU. Следующим этапом должна стать интеграция с ускорителями Hailo.
Raspberry Pi сообщает, что поддержка LiteRT и моделей Gemma готовится для Raspberry Pi AI HAT+ и AI HAT+ 2. Это позволит переносить inference на специализированный AI-ускоритель, сохраняя при этом тот же рабочий процесс LiteRT.
В результате разработчики смогут начинать создание приложения на обычном Raspberry Pi 5, используя CPU и GPU, а при необходимости увеличения производительности подключать аппаратный AI-ускоритель без полной смены программного стека.
Raspberry Pi становится полноценной платформой для Edge AI
Оптимизация LiteRT показывает дальнейшее развитие Raspberry Pi 5 в направлении локального искусственного интеллекта. Одноплатный компьютер способен одновременно выполнять компьютерное зрение, распознавание речи, генерацию текста и управление внешними устройствами.
При этом ключевой особенностью становится возможность распределять вычисления между CPU, GPU, а в перспективе и специализированными ускорителями Hailo.
Связка Raspberry Pi 5, LiteRT и Gemma позволяет создавать полностью автономные AI-системы — от интеллектуальных камер и голосовых интерфейсов до роботов и локальных AI-агентов — без обязательной зависимости от облачной инфраструктуры.
