- BrainTools - https://www.braintools.ru -

Локальный домашний инференс обычно ассоциируется [1] с полноразмерным ПК с несколькими видеокартами (иногда объединенными SLI/NVLink) и мощным блоком питания. При этом основными ограничениями такого решения зачастую являются объем оперативной и видеопамяти, а также их пропускная способность.
На волне популярности LLM-моделей для локального инференса востребованными оказались Mac miniTM [2]. Тому есть несколько причин. За счет унифицированной памяти [3] для загрузки модели доступен весь объем за исключением занятого системой. Пропускная способность этой памяти на порядок больше таковой в сравнении с DDR5. Также набор инструментов для локального инференса развился до состояния, пригодного для быстрого разворачивания.
С такими вводными Mac miniTM с памятью 24 или 48 ГБ — интересная альтернатива инференсу на десктопе. Совмещая локальную LLM-модель среднего размера и OpenClaw, пользователи организуют различные сценарии, используя персонального ИИ-агента. В этой статье попробуем запустить несколько моделей локально и проверим, оправдан ли хайп вокруг Mac miniTM.
OpenClaw [4] не является моделью. Это ИИ-агент или ИИ-ассистент, как его иногда позиционируют, работающий поверх LLM. Также у него есть интеграции с популярными сервисами: Discord, Google Chat, iMessage®, Matrix и другими. В документации [5] OpenClaw называют self-hosted шлюзом для связи приложений и мессенджеров с возможностью подключения ИИ-агентов для программирования.
Минимальные системные требования и правда малы: одно ядро процессора, 512 МБ ОЗУ, 1 ГБ диска и сеть 1 Мбит/c. Такая инсталляция заявлена как персональный бот на бюджетном облачном сервере / Raspberry Pi® для тестов или разработки.
Production- и heavy-сценарии более требовательны к ресурсам: 2/4+ ядра процессора, 8/16 ГБ ОЗУ, 20/50+ ГБ диска и сеть 10/25+ Мбит/с. В такой инсталляции связка OpenClaw + LLM может работать в рамках команды или компании, обеспечивать работу мультиагентных воркфлоу и пайплайнов автоматизации. Все перечисленные системные требования не учитывают локальное размещение модели.
Наш тестовый Mac miniTM оснащен процессором M4 Pro, 48 ГБ ОЗУ и 2 ТБ диска. «На бумаге» железо позволяет развернуть OpenClaw в самом требовательном к ресурсам сценарии. Из-за архитектуры Mac miniTM с унифицированной памятью (UMA) пул доступной оперативной памяти един для процессора и графики. Это накладывает ограничения на выбор модели: чем больше модель, тем меньше памяти останется для OpenClaw и системы.
Для тестов нужно локально развернуть LLM-модель с OpenAI-совместимым API. Одно из готовых решений — LM Studio. Оно позволяет скачивать и локально запускать модели, а также обеспечивает эндпоинты с OpenAI-совместимым API.
Кроме LM Studio существуют другие решения со схожим функционалом: llama.cpp, Ollama (на базе llama.cpp), vLLM и другие. LM Studio выигрывает для задачи «скачать модель и получить API» за счет GUI, встроенного каталога моделей и минимальной настройки. Аналоги «из коробки» требуют больше действий для такого же результата.
Установка LM Studio поддерживается в двух форматах: GUI и headless. Для тестовых целей подойдет GUI-вариант, который позволяет быстро настраивать параметры загрузки моделей и генерации и скачивать модели. Headless подойдет для развертывания на удаленной машине, например, на выделенном сервере [6], для использования разными клиентами. Сам процесс установки прост — скачать DMG-файл и установить.
Далее для локального запуска нужно загрузить модели и настроить доступ [7] к ней по API.
Загрузить модель можно в меню Model Search. По умолчанию модели отсортированы в порядке Best Match, начиная с самых больших и подходящих для устройства. Для тестового Mac miniTM LM Studio оценивает доступный для модели объем памяти в 40 ГБ.
После скачивания весов модели и загрузки в память можно пингануть модель и получить ответ.
Для запуска локального сервера нужно переключиться в меню Developer и переключить статус. Тут же видны логи.
После загрузки модели LM Studio оценивает объем занятой памяти в 21 ГБ.
После настройки локальной модели перейдем к установке OpenClaw.
Обратите внимание [8], что для лаконичности инструкции используются команды, которые скачивают неизвестный скрипт и выполняют его с правами суперпользователя. Это небезопасно, так как скрипт может быть изменен и содержать вредоносный контент.
Такой подход допустим для краткосрочных проектов на чистом сервере, однако в продуктовой среде рекомендуется устанавливать ПО вручную из доверенных источников.
curl -fsSL https://openclaw.ai/install.sh [9]
Скрипт ставит необходимые пакеты и запускает мастер настройки. Проходим его с минимальными настройками. После завершения откроем дашборд и отправим запрос на проверку состояния системы — Check system health.
«Самодиагностика» в порядке, можно переходить к тестам.
В каталоге LM Studio есть разные модели как по архитектуре, так и по размеру. Перед тестами были загружены несколько моделей из топа подходящих под железо и минимально проверена их работоспособность: модель загружается и дает скорость, пригодную для интерактивной работы (на глаз). Часть моделей не подошла из-за таймаута при генерации ответа на запрос через OpenClaw, часть не удалось загрузить. Загрузка одной из моделей привела к перезагрузке Mac miniTM по неустановленной причине. В результате осталось три модели: google/gemma-4-26b-a4b-qat, qwen/qwen3.6-35b-a3b, google/gemma-4-31b.
Протестируем скорость отклика агента. Попробуем пропинговать агента с разными моделями и сравним время их ответа. Для улучшения точности замеров предварительно закроем все тяжелые приложения в системе и будем поочередно загружать модели с контекстом 64k.
|
Модель |
Квантизация |
Формат |
Время, с |
|
google/gemma-4-26b-a4b-qat |
4bit |
MLX |
4 |
|
qwen/qwen3.6-35b-a3b |
Q4_K_M |
GGUF |
3 |
|
google/gemma-4-31b |
Q4_K_M |
GGUF |
12 |

Каталог готовых ИИ-моделей
Сервис для запуска и управления LLM в облаке Selectel. Выберите модель, конфигурацию и получите готовый эндпоинт для работы с ней.
Подробнее → [10]
Попросим OpenCLaw рассказать новости о компании Selectel. Запрос: «Расскажи новости про Selectel за последний квартал». Далее приведены полученные ответы от каждой из тестируемых моделей.
Вот основные новости по Selectel за последний квартал (Q1 2026):
—
1. Финансовые итоги Q1 2026 (опубликованы 15 мая)
– Выручка выросла на 14% г/г до 5 млрд руб. (включая 4,3 млрд от облачных инфраструктурных сервисов, тоже +14%)
– Скорректированная EBITDA — 2,7 млрд руб. (+5% г/г), рентабельность 54%
– Чистая прибыль — 0,9 млрд руб. (+4% г/г), рентабельность 18%
– Клиентская база достигла 36,6 тыс. (прирост 8,1 тыс. за год)
– Чистый долг / EBITDA LTM — 1,8x — комфортный уровень
Общий фон: двузначный рост на фоне устойчивого спроса на облачную инфраструктуру в России.
—
2. Итоги 2025 года (аудированная отчётность по МСФО, опубликована 1 апреля)
– Выручка за 2025 — 18,3 млрд руб. (+39% г/г)
– Компания подвела итоги года и опубликовала аудированную отчётность
—
3. Сделка: Catalytic People приобрела 25% Selectel (июнь 2026)
– Catalytic People (совместное предприятие Т-Технологий и Интеррос Владимира Потанина) приобрела 25% акций Selectel за 16 млрд руб.
– Доли в Catalytic People: Т-Технологии — 50,01%, Интеррос — 49,99%
– Сделка осуществляется в рамках стратегии вложений в высокотехнологичный сектор, в том числе для развития отечественных AI-моделей
– Это уже вторая волна подобных новостей: ранее (конец 2025) сообщалось о подготовке сделки
—
4. Перспективы
– Аналитики (в т.ч. T-Bank Invest, Sector IT) отмечают, что снижение ключевой ставки ЦБ положительно скажется на долговой нагрузке компании
– Выручка облачных сервисов растёт быстрее рынка — драйвером является спрос на AI-инфраструктуру
– Selectel рассчитывает удержать темпы роста и в 2026 году
Ответ содержит ошибку [11] в п. 3. Сделка была объявлена 29 декабря 2025 года, а не в июне 2026. Сам текст написан разнородно: в отсутствие аналитики остается компиляция заголовков. На генерацию ответа ушло примерно 60 секунд.
На основе финансовых отчетов за первый квартал 2026 года (который завершился в марте), можно выделить следующие ключевые новости и показатели Selectel:
### 💰 Финансовые показатели (за I квартал 2026)
* Выручка: Составила 5 млрд рублей.
* Динамика: Компания продолжает расти двузначными темпами, демонстрируя уверенную динамику даже на фоне напряженной экономической ситуации.
### 🏗️ Инвестиции и развитие (CAPEX)
Selectel продолжает активно расширять свои мощности. За прошедший квартал объем капитальных вложений (CAPEX) составил 2,8 млрд рублей, которые были распределены следующим образом:
* 1,7 млрд руб. — на закупку серверного оборудования;
* 0,9 млрд руб. — на развитие инфраструктуры дата-центров.
### 📈 Общий итог
Отчетность за первый квартал характеризуется как «спокойная и качественная». Основной фокус компании остается на расширении инфраструктуры и поддержании темпов роста за счет наращивания серверных мощностей.
В тексте нет ошибок. По форме это больше как аналитическая заметка, а по содержанию ближе к пересказу пресс-релиза. Генерация заняла также около 60 секунд.
Главная новость за последний квартал — финансовые результаты Selectel по итогам первого квартала 2026 года:
* Выручка: составила 5 млрд рублей.
* Рост: выручка увеличилась на 14% по сравнению с аналогичным периодом прошлого года.
* Отчетность: данные основаны на управленческой отчетности, соответствующей принципам МСФО.
Остальные новости в этот период носили преимущественно информационный характер, подтверждающий стабильный рост компании как независимого провайдера ИТ-инфраструктуры.
Этот ответ получился краткий и точный, но малоинформативный. Кроме того, на его генерацию ушло гораздо больше времени — 300 секунд.
Время ответа моделей собрано в таблице ниже.
|
Модель |
Время, с |
|
google/gemma-4-26b-a4b-qat |
60 |
|
qwen/qwen3.6-35b-a3b |
60 |
|
google/gemma-4-31b |
300 |
Самый детальный ответ дала модель qwen3.6-35b-a3b за минимальное из всех моделей время. Модель gemma-4-31b генерировала ответ дольше всех, однако детализированность ответа меньше таковой у gemma-4-26b-a4b-qat.
Посмотрим, сколько «попугаев» в синтетических тестах покажет Mac miniTM M4 Pro. Воспользуемся Anubis [12] — open-source приложением для тестирования производительности локальных LLM-моделей на процессорах линейки Apple Silicon.
Список моделей тот же — для сравнимости. В таблице указаны средние значения результатов 20 запусков.
|
Модель |
Токенов в секунду |
Джоулей на 1 токен |
TTFT, мс |
Задержка генерации токена, мс |
|
google/gemma-4-26b-a4b-qat |
59 |
0,38 |
237 |
17 |
|
qwen/qwen3.6-35b-a3b |
50 |
0,45 |
96 |
20 |
|
google/gemma-4-31b |
10 |
2,73 |
1 217 |
97 |
Самой быстрой моделью по генерации токенов оказалась gemma-4-26b-a4b-qat — она же, по версии Anubis, еще и самая энергоэффективная. При схожей с qwen3.6-35b-a3b задержке генерации показатель TTFT (Time to First Token, время до первого токена) у модели Gemma оказался выше.
Во всех тестах загруженность CPU не превышала 10%, в то время как загрузка GPU стабильно находилась около 99%. Такая загрузка показывает, что вычисления ложатся на GPU-часть Apple Silicon. Это ожидаемо для LLM-инференса через ML-фреймворки.
gemma-4-31b — последняя по скорости и энергоэффективности. Плотная модель на 31B параметров без квантования ожидаемо проигрывает MoE-архитектурам: 10 токенов/с против 50–59, энергозатраты выше примерно в 6–7 раз.
Обе MoE-модели gemma-4-26b-a4b-qat и qwen3.6-35b-a3b лидируют по пропускной способности. У них меньше активных параметров и быстрее инференс.
Модель gemma-4-31b менее детальна, чем gemma-4-26b-a4b-qat. Плотная 31B-модель при 5-кратной разнице во времени генерации (300 с vs 60 с) выдала худший по детализации результат, чем квантованная 26B MoE.
Модель qwen3.6-35b-a3b дает самый детальный ответ при наименьшем числе активных параметров. Казалось бы, модель с меньшим числом активных параметров должна выдавать менее развернутые ответы, но, вероятно, пропорциональной потери качества не происходит за счет архитектуры и качества обучающей выборки.
По результатам тестов локальный запуск LLM на Mac miniTM выглядит вполне юзабельным. LLM-модели среднего размера выдают ответы с небольшой задержкой, что в сочетании с OpenClaw позволяет сделать из Mac miniTM полноценного ИИ-ассистента без использования подписок провайдеров LLM. Арендовать Mac miniTM в Selectel можно на странице выделенных серверов [2].
А для моделей большего размера можно рассмотреть выделенные или облачные серверы [13] с более производительными GPU, в том числе с GPU NVIDIA® H300.
Автор: solidfiftyfifty
Источник [14]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/33427
URLs in this post:
[1] ассоциируется: http://www.braintools.ru/article/621
[2] Mac miniTM: https://selectel.ru/services/dedicated/mac/?utm_source=habr.com&utm_medium=referral&utm_campaign=mac_article_mac-mini-feat-openclaw_230726_content
[3] памяти: http://www.braintools.ru/article/4140
[4] OpenClaw: https://habr.com/ru/companies/selectel/articles/1009278/
[5] В документации: https://docs.openclaw.ai/
[6] на выделенном сервере: https://selectel.ru/services/dedicated?utm_source=habr.com&utm_medium=referral&utm_campaign=dedicated_article_mac-mini-feat-openclaw_230726_content
[7] настроить доступ: https://lmstudio.ai/docs/developer/core/server
[8] внимание: http://www.braintools.ru/article/7595
[9] https://openclaw.ai/install.sh: https://openclaw.ai/install.sh
[10] Подробнее →: https://selectel.ru/services/cloud/foundation-models-catalog/?utm_source=habr.com&utm_medium=referral&utm_campaign=fmc_article_mac-mini-feat-openclaw_230726_banner_ord
[11] ошибку: http://www.braintools.ru/article/4192
[12] Anubis: https://github.com/uncSoft/anubis-oss
[13] выделенные или облачные серверы: https://selectel.ru/services/gpu?utm_source=habr.com&utm_medium=referral&utm_campaign=gpu_article_mac-mini-feat-openclaw_230726_content
[14] Источник: https://habr.com/ru/companies/selectel/articles/1061276/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1061276
Нажмите здесь для печати.