Apple Silicon.

Локальный агент для кода на Mac: MTPLX + pi + Qwen3.8–27B. Что реально ускоряет, а что нет

Я хотел, чтобы кодовый агент работал целиком на ноутбуке, без облака: локальная модель, локальный сервер, агент в терминале. Главная боль с самого начала — скорость. Агент постоянно перечитывает длинный контекст и много «думает», и на локальном железе это превращается в минуты ожидания на каждую задачу.

продолжить чтение

Сколько токенов в секунду выдадут новые Mac mini на M6 и M5 Pro. Прогноз до того, как железо приехало

Дисклеймер. Я держу сервис аренды маков, у меня флот одинаковых Mac mini и повод их гонять. Первые машины на M6 и M5 Pro у нас появятся вскоре после старта продаж, тогда выйдет вторая часть с реальными замерами. Единственная ссылка в тексте ведёт на страницу с данными, они открыты.Зачем прогноз, если можно подождать замерЧерез несколько дней Apple начнёт отгружать Mac mini на M6 и M5 Pro и Mac Studio на M5 Max и M5 Ultra. Первую неделю все будут спрашивать одно и то же, сколько это железо выдаёт на локальных моделях, а ответов не будет ни у кого, потому что машины только доехали.

продолжить чтение

Qwen3.8-27B: лучший локальный LLM, который вы, вероятно, не сможете запустить

В этом месяце Alibaba выпустила две модели, и та, о которой все писали, оказалась не той, что мы ждали. Qwen3.8-Max — это API с 2,4 триллионами параметров, и пару недель назад я с большим энтузиазмом написал о ней обзор. Но релиз, которого я действительно ждал, вышел 14 августа: Qwen3.8-27B, Apache 2.0, веса на Hugging Face, модель достаточно компактна, чтобы работать на ноутбуке.

продолжить чтение

Всё, что вы хотели знать о локальном ИИ, но стеснялись спросить

РептилоидЕсли вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти разных людей — или давно собирались поднять LLM у себя, но всё не находили повода — выход Muse Glimmer 30B буквально лучший момент начать.

продолжить чтение

Локальные LLM на iPhone: память, Core ML, MLX и ограничения

Всем привет! Меня зовут Никита Нагорнов, я iOS‑разработчик в компании «Исходный Код». В этой статье разберем, как запускать локальные LLM на iPhone.Поговорим про:Архитектуру Apple Silicon и Unified Memory — почему не можем использовать всю доступную память;Память, квантование и KV Cache — где приложения начинают падать и как это отловить;Core ML и MLX — чем отличаются, где какой быстрее и почему нельзя всё запускать на нейронном процессоре;Температуру и троттлинг — что происходит с телефоном на длинной сессии;

продолжить чтение

Пять неправильных токенов и 245 картинок: как Krea 2 заработала на Swift и MLX

На момент снимка в локальной Gallery было 245 изображений. Пользовательские файлы в публичный репозиторий не входят.

продолжить чтение

56 минут созвона → текст за 5 минут на M4 без OBS и облака

продолжить чтение

Шесть часов на один рендер: как я собрал нативную студию Ideogram 4 на Swift и MLX

Эта картинка рисовалась на моём Mac 384 минуты 55 секунд.Quality, 48 шагов, 2048×2048 — 384 минуты 55 секунд, почти шесть с половиной часов.

продолжить чтение

«Четыре шага — и точка» Я сам придумал главное ограничение своего приложения

Пару недель назад я рассказывал здесь, как три ночи чинил рендер, который не был сломан

продолжить чтение

Картинки рвало полосами, а файлы при этом были чистыми

Три ночи я был уверен, что у меня сломан рендер.Вертикальные картинки — те самые 9:16, под обои телефона и под сторис, — на экране разъезжались горизонтальными полосами. Как будто старый телевизор поймал помехи. Квадрат рисуется нормально. Горизонталь — нормально. А вертикалку рвёт в труху.Три раза я её «починил». И все три раза чинил вообще не то.Правда оказалась дурацкой и красивой одновременно: файлы были в полном порядке. Рвало только то, как macOS показывала их на экране. Но к этому моменту я уже немного поседел.

продолжить чтение

12