Ещё недавно для работы с масштабными нейросетями требовались мощные дата-центры, но теперь Google Gemma 4 26B-A4B – модель с 26 миллиардами параметров и архитектурой mixture-of-experts (MoE) – позволяет запускать сложные модели на обычном ноутбуке. Благодаря активации лишь 8 из 128 экспертов для каждого токена, модель работает на 48 ГБ объединённой памяти, показывая качество, сопоставимое с гигантами вроде Qwen 3.5 (397 млрд параметров).
Обновление LM Studio 0.4.0 внедрило фоновый демон llmster и консольную утилиту lms, что значительно облегчает запуск и управление локальными моделями. Также добавлен эндпойнт, совместимый с Anthropic, позволяющий направлять Claude Code на локальную Gemma 4.
Google выпустила семейство Gemma 4 из четырёх вариантов, оптимизированных для разных устройств, включая модели с поддержкой речи и самой мощной плотной версией 31B. Gemma 4 26B-A4B выгодно отличается эффективностью: при ресурсе 4 млрд активных параметров она демонстрирует качество плотной 10-миллиардной модели, работая при этом гораздо быстрее.
На MacBook Pro с 48 ГБ памяти модель выдает около 51 токена в секунду при контексте до 256K токенов. LM Studio позволяет гибко настраивать параметры загрузки, распределять нагрузку между CPU и GPU, а также использовать функции непрерывного батчинга и TTL для автоматической выгрузки моделей.
Спекулятивное декодирование пока неэффективно для MoE-моделей из-за высокой нагрузки на память, однако flash attention помогает экономить ресурсы при работе с длинным контекстом. Локальный запуск модели совместим с API OpenAI и Anthropic, что позволяет использовать её как сервер для различных приложений.
Настройка Claude Code для работы с локальной Gemma 4 обеспечивает приватность и стабильность, хотя скорости локального инференса уступают облачным сервисам. В итоге архитектура MoE и обновления LM Studio открывают новые возможности для персонального использования нейросетей без необходимости в мощных дата-центрах.