- BrainTools - https://www.braintools.ru -
В течение последних нескольких дней я тестировал (на данный момент [1]) топовую модель Mac Studio M5 Ultra с 256 ГБ оперативной памяти [2].
Перейду сразу к сути: Mac Studio M5 Ultra — это идеальная машина для локальных ИИ‑агентов. Этот компьютер позволяет запускать персональных помощников на базе локальных моделей с высокой производительностью и без дополнительных затрат на облачные сервисы. Если вы скептически относились к тестированию OpenClaw [3] или Hermes Agent [4] с локальными моделями, считая, что они никогда не достигнут уровня интеллекта [5] и скорости облачных моделей, этот Mac изменит ваше мнение.
Начиная с прошлого четверга, я сравнивал этот Mac Studio с его предшественником, M3 Ultra с 512 ГБ оперативной памяти [6], а также со своим собственным игровым настольным ПК с RTX 5090. Учитывая его размер, цену, тепловые характеристики — не говоря уже о подходе Apple к унифицированной памяти — Mac Studio M5 Ultra коренным образом изменил мое представление о моделях, работающих локально, и о том, что они теперь могут предложить. Конечно, 5090 по‑прежнему имеет преимущество перед M5 Ultra благодаря более высокой пропускной способности памяти [7]. Но, учитывая огромные размеры моей сборки ПК, а также его тепловыделение и шум, я бы предпочел Mac Studio M5 Ultra в любой день. К тому же, это Mac с приятной и неплохой операционной системой, а также с развитой экосистемой приложений. (Поклонники Windows, извините, но программное обеспечение Microsoft никогда не вызовет у меня сочувствия.)
Как я покажу в этой статье, запуск последней модели Qwen3.8-Flash‑Next [8] на Mac Studio с процессором M5 Ultra оказался настолько быстрым и удобным, что я сделал её своей основной моделью как в Open Minis для iOS, [9] так и в Hermes Agent. Да, вы правильно поняли: мои самые часто используемые персональные помощники — даже чаще, чем Siri AI [10] — теперь полностью работают на основе модели, запущенной локально на Mac Studio. Более того, благодаря более быстрому графическому процессору M5 Ultra и большей пропускной способности памяти, эти агенты начинают реагировать [11] быстрее, сохраняют высокую скорость при больших контекстных окнах и могут запускать длинные многоходовые циклы, не замедляясь до черепашьей скорости по мере роста сессии. Поэтому я также использую локальные модели в приложении Codex на своём Mac — либо в качестве основных потоков, либо в качестве субагентов, управляемых GPT-6 Astra — и у меня остались отличные впечатления [12] от этого.
Сейчас мои наиболее часто используемые персональные помощники полностью работают на основе модели, запущенной локально на Mac Studio.
Сразу оговорюсь, что я не профессиональный разработчик ИИ: я не занимаюсь обучением [13] или тонкой настройкой моделей. Я по натуре изобретатель, и уже больше года [14] экспериментирую с локальными моделями ИИ. Этим летом я полностью переключился на использование локального ИИ в крупном проекте, над которым работал, о чем расскажу в следующем разделе.
Цель этой статьи — предоставить вам сочетание двух вещей: цифр и визуализаций, основанных на (многочисленных) тестах, которые я проводил в течение четырех дней, и объяснение моих практических примеров применения локального ИИ в моем рабочем процессе и того, как я выполняю задачи для MacStories.
Давайте начнём.
Давайте сначала разберемся с самым очевидным: зачем вообще нужен локальный ИИ, если облачные модели на переднем крае технологий лучше и зачастую быстрее?
Это вполне резонный вопрос. Для запуска этих моделей требуется дорогостоящее оборудование, и к тому времени, как вы окупите свои инвестиции, вы могли бы использовать самую дорогую подписку на Anthropic в течение нескольких лет, при этом сэкономив деньги и получив взамен более высокую производительность.
У разных людей будут разные ответы на этот вопрос. Некоторые могут сказать, что используют локальные модели из‑за конфиденциальности: они предпочитают полагаться на локальный интеллект для обработки конфиденциальных данных и документов, чем загружать что‑либо во внешнее облако. Другие могут утверждать, что это просто круто — и я с этим согласен. Для некоторых это задача, связанная с работой: если вы разработчик ИИ, то имеет смысл иметь отличную локальную среду для обучения собственных адаптеров или тонкой настройки моделей.
Для меня освоение локального ИИ было сопряжено как с чувством ” круто, а почему бы и нет? «, так и с соображениями конфиденциальности и стоимости.»
Как я расскажу позже на этой неделе членам Club MacStories [15], моя исследовательская и писательская работа над обзором iOS и iPadOS 27 [16] этим летом осуществлялась с помощью локального ИИ. Еще в июне я создал внутреннее приложение под названием Desk для организации сотен заметок, сессий, PDF‑документов и фрагментов веб‑страниц, связанных с iOS и iPadOS 27, а также главами обзора. К концу работы проект насчитывал 310 документов. В Desk команда агентов — все на основе DeepSeek V4 Flash [17], плюс olmOCR [18] для PDF‑файлов — работала круглосуточно в течение 99 дней, выполняя следующие задачи:
Расшифровка моих любимых сессий WWDC (с использованием summarize [19]обработки Plus LLM).
Извлечение информации о функциях iOS и iPadOS 27 из фрагментов веб‑страниц, материалов сессий, руководств в формате PDF и моих собственных заметок.
Сопоставляйте информацию о характеристиках из разных источников и отслеживайте, какие характеристики относятся к какой главе обзора.
Извлечение функций и ошибок из загруженных мной скриншотов.
Используйте API Notion для организации всей информации в нескольких базах данных.
Когда я начал работать с этой системой в начале июня, я быстро понял, что полагаться на API OpenAI или Anthropics для выполнения подобных постоянно работающих фоновых задач будет, мягко говоря, слишком дорого. Поэтому я переключился на локальный ИИ, и результатом стал обзор iOS и iPadOS 27, который вы можете прочитать на MacStories [16]. Всё это было написано мной, старым добрым человеческим способом. Но весь исследовательский процесс, создание глубоких ссылок между заметками и отслеживание новых функций и бета‑версий были выполнены моими агентами, работающими локально на Mac Studio, и обошлися мне всего в 0 долларов.
Если вам это не кажется интересным или недостаточно перспективной концепцией, то эта статья, вероятно, не для вас — и я понимаю. Работа с такими моделями сложна, и я бы никогда не рекомендовал это тому, кто (по праву) просто хочет заплатить 20 долларов за использование Claude Cowork. Подобная система, по определению, является передовой в области рабочих процессов с использованием ИИ на данный момент.
Если же вы относитесь к противоположной категории и считаете подобные вещи интересными… позвольте мне сказать: Mac Studio M5 Ultra — это огромный скачок в производительности по сравнению с локальными моделями на базе MLX [20], и у меня есть несколько примеров, подтверждающих это.
Как вы, возможно, видели из анонса [21] и моих первоначальных обзоров [22], Mac Studio M5 Ultra выглядит идентично модели M3 Ultra, которую он заменяет, но он оснащен совершенно новой архитектурой Apple Silicon, использующей UltraFusion для соединения двух двухкристальных чипов M5 Max в четырехкристальную архитектуру, что является первым подобным решением в экосистеме Apple. Что касается локальных задач ИИ, то здесь есть две области, на которые нам следует обратить внимание [23] (и за которыми я слежу с момента моих обзоров iPad Pro M5 для локального ИИ [24] в прошлом году): графический процессор и пропускная способность памяти.
M5 Ultra оснащен графическим процессором нового поколения с 80 ядрами, каждое из которых имеет нейронный ускоритель, что обеспечивает ему до 4,5 раз большую пиковую вычислительную мощность для ИИ по сравнению с M3 Ultra. Что касается памяти, унифицированная архитектура памяти Apple по‑прежнему достигает максимума в 512 ГБ, как и раньше (хотя эта модель выйдет в конце октября), но ее пропускная способность выросла с 819 ГБ/с до 1,2 ТБ/с, что на 50% выше, чем у M3 Ultra.
Учитывая эти показатели, я начал тестирование M5 Ultra в сравнении с M3 Ultra с 512 ГБ оперативной памяти и моей RTX 5090. Подробнее о тестировании я расскажу ниже, но вкратце: с M5 Ultra вы тратите значительно меньше времени на ожидание, пока модель прочтет ваш запрос и начнет генерировать ответ; а когда она начинает отвечать, текст появляется гораздо быстрее, чем раньше на M3 Ultra. Только эти два улучшения делают машину пригодной для современных агентных циклов, требующих быстрой итерации с моделью и, как следствие, больших контекстных окон.


В моем повседневном опыте [25] работы с агентами на M5 Ultra я сразу заметил улучшения в предварительном заполнении токенов (или скорости обработки запроса) и генерации токенов. При сравнении модели, работающей на M3 Ultra и M5 Ultra, с Open Mini на iOS, M5 Ultra в среднем оказалась примерно на 70% быстрее, чем M3 Ultra, в генерации ответа. Как мы увидим позже, модель, такая как Qwen3.8-Flash‑Next, обрабатывающая 100 токенов в секунду на коротких запросах и при этом генерирующая от 60 до 85 токенов с контекстом от 64 до 256 КБ, — это не шутка, и это обеспечивает такой агентский обмен данными между вами и моделью, который очень удобен в использовании, особенно при вызове инструментов.
Однако меня больше впечатлило повышение производительности заполнения токенов. При использовании агентных помощников, таких как Hermes или Codex, модель получает целый блок инструкций, включающий в себя системную подсказку, персонализацию пользователя и память сессии, описания навыков и MCP и многое другое. Некоторые агенты лучше других справляются с сокращением отправляемых инструкций, но, как правило, при использовании современного агента вы не начинаете с пустого контекстного окна. Из‑за этого мне никогда не удавалось стабильно использовать локальные модели с этим новым поколением агентов: они работали, но я долго смотрел на пустой экран и индикатор загрузки, прежде чем модель начинала генерировать ответ. И с каждым оборотом цикла производительность ухудшалась (из‑за большего контекста сессии), и мне приходилось ждать еще некоторое время.
В моих тестах обработка запросов в среднем увеличилась на 150% по сравнению с M3 Ultra — примерно в 2,5 раза по сравнению с моей предыдущей конфигурацией. Уже одно это изменение делает локальные модели надежным выбором в таких приложениях, как Open Minis и Hermes Agent. Когда я прошу Flash‑Next на M5 Ultra получить мои задачи на неделю с помощью RemCTL [26], мне не нужно ждать, пока агент обработает мой запрос и запрос Open Minis: всего за несколько секунд он приступает к работе, выполняя логические действия, вызовы инструментов и так далее. А когда я работаю над большим проектом, таким как демонстрация воксельного Колизея ниже, модель способна быстро обрабатывать многоходовые циклы, распределять и координировать действия субагентов, и все это со скоростью от 60 до 85 токенов в секунду по мере увеличения длины потока.
Чтобы использовать локальные модели из Mac Studio в Open Mini для iOS, я создал локальный сервер перед API, совместимым с OpenAI и предоставляемым локально oMLX [27]. Он запускается через Tailscale на мой iPhone и работает замечательно.
Я большой сторонник ассистентов, которые могут самостоятельно выполнять задачи в дополнение к ответам на вопросы, но для того, чтобы ими было приятно пользоваться, они должны быть быстрыми. За последние несколько месяцев я протестировал несколько «бутиковых» облачных провайдеров с Open Minis: Inco [28], который обслуживает Kimi K3 со скоростью более 300 транзакций в секунду; Cerebras [29] с Qwen3.8–27B, достигающей впечатляющих 1800 транзакций в секунду; и такие провайдеры, как Fireworks [30] и Baseten [31], каждый из которых преодолел барьер в 150 транзакций в секунду. Все эти провайдеры очень удобны в использовании в Open Minis и Hermes, но они дороги (на прошлой неделе я потратил 20 долларов кредитов Inco буквально за 10 минут), и, конечно же, все мои данные куда‑то уходят, когда я их использую. Когда я запускаю Open Minis с Flash‑Next и набором командных строк Apple, которые я создаю, все остается локально, внутри компьютера, который я могу видеть и перезагружать в любое время.
Самое важное: такая модель, как Flash‑Next, может быть достаточно «маленькой», чтобы работать с более высокими степенями квантизации [34] на 256-гигабайтном M5 Ultra (я могу запускать 5-битные вычисления полностью в оперативной памяти; 6- и 8-битные могут переносить свои таблицы n‑грамм [35] на SSD с помощью этой новой архитектуры [8] ), но при этом достаточно интеллектуальной, чтобы поддерживать длительные потоки и множество вызовов инструментов агента.
На мой взгляд, 5-битное квантование в этой версии Ultra — оптимальный баланс между интеллектуальностью, производительностью и потреблением памяти. Но я уже знаю, что если мне когда‑нибудь доведется протестировать M5 Ultra на 512 ГБ, мне будет очень интересно измерить производительность 8-битного квантования без использования SSD‑накопителя.
Я не уделял много времени настройке переноса задач кодирования для своих различных проектов на локальную модель, но провел несколько интересных экспериментов. С такой производительностью, и особенно учитывая возможность одновременного запуска до трех сессий Flash‑Next с субагентами в oMLX [27] с 256 ГБ оперативной памяти (подробнее позже), я теперь могу реально рассматривать возможность передачи более простых задач кодирования локальной модели, а облачные модели будут проверять их работу. Например, мне удалось настроить Qwen3.8-Flash‑Next в Codex, что позволяет использовать локальную модель с Codex. Это означает, что я могу позволить основной модели GPT управлять локальными субагентами, Flash‑Next координировать работу своих субагентов или даже просто использовать модель со своего телефона с помощью Codex Remote на iOS.
Мне любопытно узнать больше на эту тему от реальных разработчиков, которые скоро получат M5 Ultra. Учитывая, что модели с открытыми весами теперь превосходят на потребительском оборудовании то, что считалось «передовым» примерно 10 месяцев назад, и что производительность на M5 Ultra делает возможным программирование с использованием агентов, я думаю, что очень скоро мы увидим несколько захватывающих экспериментов от сообщества MLX.
Как вы увидите из визуализаций, представленных далее в этой статье, NVIDIA RTX 5090 по‑прежнему быстрее, чем Apple M5 Ultra, несмотря на свои «скромные» 32 ГБ видеопамяти, и тому есть две разные причины.
Скорость обработки запросов определяется вычислительными ресурсами: модель считывает весь запрос за одно гигантское матричное умножение [36], что в точности соответствует задачам, для которых были созданы тензорные ядра NVIDIA [37]. Новые нейронные ускорители Apple (по одному в каждом из 80 ядер GPU M5 Ultra) сокращают разрыв, но не могут его полностью устранить. При запросе на 6000 токенов M5 Ultra считывал данные со скоростью ~1700 токенов в секунду; 5090 показал ошеломляющие ~3000 токенов в секунду с моделью Qwen, которую я тестировал в LM Studio. Генерация токенов, с другой стороны, зависит от пропускной способности: модель записывает по одному токену за раз и извлекает всю модель из памяти для каждого из них, поэтому 1,79 ТБ/с у 5090 против 1,2 ТБ/с у M5 Ultra дают ему стабильное преимущество примерно в 25% при любом размере запроса. Чего у 5090 нет, так это памяти: при объеме 256 КБ она имеет только 8-битный кэш внимания. 32 ГБ видеопамяти — это еще не все.
Однако в этом сравнении есть две проблемы. Во‑первых, хотя 5090 всё ещё немного превосходит M5 Ultra в случае с более компактными моделями, отсутствие единого пула памяти означает, что я ограничен 32 ГБ видеопамяти в графическом процессоре, если хочу запускать модели на невероятно высокой скорости. Как только мне понадобится запустить что‑либо, превышающее 32 ГБ (например, упомянутые выше вычисления с большим количеством квантов Flash‑Next), 5090 придётся переносить слои модели через PCIe в (гораздо более медленную) системную оперативную память, а это неприемлемо.
Во‑вторых, мой игровой ПК огромен по сравнению с Mac Studio, который помещается на моем столе, — а у меня компактная сборка [38] в корпусе Lian‑Li A3. Не говоря уже о том, насколько он шумит и нагревается, когда я запускаю локальные тесты в окнах с высокой контекстной загрузкой: когда я зашел в свой кабинет после запуска нескольких бенчмарков, там было неприятно теплее, чем в остальной части моей квартиры. В отличие от него, «миниатюрный» Mac Studio на моем столе был теплым на ощупь, но при этом заметно тише, чем моя 5090, вентиляторы вращались не так быстро и громко, и, что наиболее важно, он позволял мне запускать более крупные тесты, такие как GLM-5.3-Flash, локально с достойной производительностью благодаря унифицированной памяти Apple Silicon. В повседневном использовании, когда я постоянно запускал Flash‑Next oQ4e [39], я никогда не слышал вентилятор Studio на своем столе, если только не прикладывал ухо прямо к компьютеру.
Судя по прогрессу, достигнутому Apple за последние годы, я бы не удивился, если бы в ближайшем будущем появилась видеокарта M7 Ultra [40], которая превзошла бы по пропускной способности памяти 5090. Но это уже тема для отдельного разговора.
И наконец, прежде чем мы перейдем к цифрам и графикам: как я все тестировал?
Автоматизированные тесты проводились с помощью созданной мной тестовой среды на базе GPT-6 Astra, которая координировала работу нескольких экземпляров Codex на моих Mac Studio M3 Ultra и M5 Ultra, а также на моем ПК с приложением Codex для Windows и Computer Use. На macOS я выбрал oMLX (версия 0.7.0.dev [41]2) в качестве локального бэкенда для моделей MLX и запускал Qwen3.8-Flash‑Next‑oQ4e‑mtp [42], GLM-5.3-Flash‑MLX‑mixed-4_8bit [43] и Qwen3.8–27B‑oQ4e‑mtp [44] на macOS Golden Gate 27.0 для большинства тестов. На Windows я использовал LM Studio и Qwen3.8–27B‑GGUF [45] с средой выполнения CUDA 12 и с переносом всех 66 слоев на графический процессор для тестов с полной загрузкой GPU, а также отдельные тесты, разделяющие модель между графическим процессором и системной оперативной памятью.
Помимо отдельных экспериментов с собственными субагентами Open Minis, я использовал специальную тестовую среду для измерения количества одновременных запросов и рабочих процессов, включающих модель лида и несколько помощников, при этом oMLX обслуживал модели для Mac, а LM Studio — модель для Windows.
Данные были собраны программой Astra в течение четырех дней, а затем визуализированы программами Claude Fable 5.1 и Opus 5 с использованием готовящейся к выпуску функции Projects от Anthropic [46], которую я смог протестировать на раннем этапе работы над этим материалом. Интерактивная визуализация была создана с использованием чистого HTML и CSS в стиле MacStories и включает комментарии и аннотации от меня лично.
Моя цель при создании следующих интерактивных виджетов заключалась не только в том, чтобы помочь вам лучше понять цифры, но и в том, чтобы визуализировать, что означают эти статистические данные на практике. Я вполне доволен виджетами, которые приблизительно отражают реальное количество токенов в секунду, поскольку этот показатель часто сложно визуализировать. Надеюсь, эти анимированные графики будут полезнее обычных «статичных», которые вы, вероятно, видели где‑то ещё (они также включены ниже).
Автор: AI_Web3
Источник [47]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/35923
URLs in this post:
[1] на данный момент: https://forums.macrumors.com/threads/mac-studio-with-m5-ultra-chip-and-512gb-of-ram-launching-in-october.2487936/
[2] памяти: http://www.braintools.ru/article/4140
[3] OpenClaw: https://openclaw.ai/
[4] Hermes Agent: https://hermes-agent.nousresearch.com/
[5] интеллекта: http://www.braintools.ru/article/7605
[6] M3 Ultra с 512 ГБ оперативной памяти: https://www.macstories.net/notes/testing-deepseek-r1-0528-on-the-m3-ultra-mac-studio-and-installing-local-gguf-models-with-ollama-on-macos/
[7] более высокой пропускной способности памяти: https://www.nvidia.com/en-us/geforce/graphics-cards/50-series/rtx-5090/
[8] модели Qwen3.8-Flash‑Next: https://qwen.ai/blog?id=qwen3.8-flash-next
[9] Open Minis для iOS,: https://openminis.app/
[10] даже чаще, чем Siri AI: https://www.macstories.net/reviews/open-minis-is-the-ios-agent-i-wish-siri-ai-could-be/
[11] реагировать: http://www.braintools.ru/article/1549
[12] впечатления: http://www.braintools.ru/article/2012
[13] обучением: http://www.braintools.ru/article/5125
[14] уже больше года: https://www.macstories.net/notes/notes-on-early-mac-studio-ai-benchmarks-with-qwen3-235b-a22b-and-qwen2-5-vl-72b/
[15] членам Club MacStories: https://www.macstories.net/plans/
[16] обзором iOS и iPadOS 27: https://www.macstories.net/stories/ios-and-ipados-27-review/
[17] DeepSeek V4 Flash: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash
[18] olmOCR: https://github.com/allenai/olmocr/tree/main
[19] summarize: https://github.com/steipete/summarize
[20] MLX: https://github.com/ml-explore/mlx
[21] анонса: https://www.apple.com/newsroom/2026/08/apple-introduces-m6-and-m5-ultra-for-a-big-leap-in-performance-and-ai-compute/
[22] моих первоначальных обзоров: https://www.macstories.net/notes/the-potential-of-m6-and-m5-ultra-for-local-ai-on-macos/
[23] внимание: http://www.braintools.ru/article/7595
[24] iPad Pro M5 для локального ИИ: https://www.macstories.net/stories/ipad-pro-m5-neural-benchmarks-mlx/
[25] опыте: http://www.braintools.ru/article/6952
[26] RemCTL: https://github.com/viticci/remctl
[27] oMLX: https://github.com/jundot/omlx
[28] Inco: https://inco.ai/blog/inco-platform-aa/
[29] Cerebras: https://inference-docs.cerebras.ai/models/qwen-3.8-27b
[30] Fireworks: https://fireworks.ai/
[31] Baseten: https://www.baseten.co/
[32] разрабатываемый iOS‑клиент для Hermes Agent: https://cadu.bot/
[33] Qwen3-TTS: https://qwen.ai/blog?id=qwen3tts-0115
[34] степенями квантизации: https://en.wikipedia.org/wiki/Large_language_model#Quantization
[35] таблицы n‑грамм: https://huggingface.co/blog/Blackroot/what-the-engram
[36] матричное умножение: https://en.wikipedia.org/wiki/Matrix_multiplication
[37] тензорные ядра NVIDIA: https://www.nvidia.com/en-us/data-center/tensor-cores/
[38] компактная сборка: https://uk.pcpartpicker.com/list/Yzpzh9
[39] Flash‑Next oQ4e: https://huggingface.co/Jundot/Qwen3.8-Flash-Next-oQ4e-mtp
[40] M7 Ultra: https://www.bloomberg.com/news/newsletters/2026-07-12/apple-s-chip-plans-m6-m7-pro-m7-max-m7-ultra-m8-details-touch-macbook-pro
[41] 0.7.0.dev: http://0.7.0.dev
[42] Qwen3.8-Flash‑Next‑oQ4e‑mtp: https://huggingface.co/Jundot/Qwen3.8-Flash-Next-oQ4e-mtp/tree/2615fc0e976e65c2f3b55daca3a948f1cdc5b9f8
[43] GLM-5.3-Flash‑MLX‑mixed-4_8bit: https://huggingface.co/pipenetwork/GLM-5.3-Flash-MLX-mixed-4_8bit/tree/d43ea8b407ce4e9c25e6ac9baec3feab70d9f5f3
[44] Qwen3.8–27B‑oQ4e‑mtp: https://huggingface.co/Jundot/Qwen3.8-27B-oQ4e-mtp/tree/04dc5509edd8670fc78cc8c2f74bf9b77b1f2acc
[45] Qwen3.8–27B‑GGUF: https://huggingface.co/lmstudio-community/Qwen3.8-27B-GGUF/blob/5a7da681f60570ab5b439a587e912d2e5eddb582/Qwen3.8-27B-Q4_K_M.gguf
[46] готовящейся к выпуску функции Projects от Anthropic: https://claude.com/blog/projects-redesigned
[47] Источник: https://habr.com/ru/articles/1085848/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1085848
Нажмите здесь для печати.