glm.
Вайбкодинг на минималках: как настройка OpenClaw убила веру в магию нейросетей (или история дефолт-юзера с openclaw)
ОГЛАВЛЕНИЯ:ВВОДНАЯ ЧАСТЬОЖИДАНИЕ ОТ ПРОГРАММЫПЕРВАЯ УСТАНОВКАСТОИМОСТЬ И ИСПОЛЬЗУЕМЫЕ МОДЕЛИ
Энтузиаст запустил GLM-5.2 на ноутбуке с 25 ГБ RAM: без дистилляции, но на скорости от 0,05 токена в секунду
Разработчик-одиночка под ником JustVugg представил Colibri
Что думают ТОП-компании про перестройку на AI native
Здравствуй, Хабр!Я давно сознательно избегал трех бесячих тем: фронтир-моделей, автономных агентов ради самих агентов и разговоров про AI-native компании. Потому что вокруг них сейчас слишком много маркетинга и слишком мало инженерной конкретики.Но после доклада AWS про команды в мире агентского ИИ стало понятно, что интересный вопрос тут не какая модель победит, а какая операционная модель переживет удешевление разработки и придумали ли уже что-то по делу. Статья перед тобой разбор тысяч публикаций про то что думают всяки MAANG о том какие команды в итоге получатся.
Собрал ИИ-бенчмарк под себя из 2 месяцев своих сессий — и дорогие модели проиграли дешёвым
Собрал ИИ-бенчмарк под себя — и дорогие модели проиграли дешёвымПубличные лидерборды сходятся: сильнейшая открытая модель сейчас — GLM-5.2 на 744 миллиарда параметров. За ней — Kimi K2.6, DeepSeek V4. Я пару месяцев доверял этим таблицам и гонял через лучшие модели свою ежедневную работу.Потом измерил то, чего лидерборды не могут измерить — как работаю конкретно я. Тройка лидеров сжалась в ничью, а победила в практике модель в 37 раз дешевле GLM-5.2.Дальше — как я это мерил, на чём, какие были грабли, и почему «лучшая модель» и «лучшая модель для тебя» — это разные модели.Почему чужой лидерборд не подберет модель под тебя
Как использовать новые Qwen3.7 Plus в России и GLM 5.2 на русском
Qwen3.7 Plus от Alibaba и GLM 5.2 от Z.AI теперь работают без VPN. Обе заточены под кодинг и агентные задачи, обе держат миллион токенов контекста, и обе могут вам пригодиться. Как получить к ним доступ без подписок и сервисов обхода, разбираемся в этой статье.Qwen3.7 Plus: мультимодальный агент за копейкиQwen3.7 Plus — это мультимодальная версия агентного бэкбона Qwen3.7 примерно в шесть раз дешевле, чем флагманский Qwen3.7 Max.
Эксперимент: может ли группа LLM отбирать стартапы лучше человека?
Оценивая текущую повестку вокруг ИИ, многие резонно замечают парадокс. Шума много, ботов ещё больше, а сгенерированных картинок и красивых концептов — бесконечный поток. Мы даже видим волны увольнений из-за повальной оптимизации, но где осязаемые результаты? Где то самое «пощупать»? Настоящая эффективность, которую можно поставить на стол перед скептиком и сказать: смотрите, вот оно работает. Без идеализации, но с пониманием реального потенциала.Безусловно, у технологии есть мощные стороны. Я сам о них писал (раз
Как и зачем мы сделали собственный OCR-бенчмарк
Однажды нам понадобилось выбрать OCR-модель для RAG-пайплайна. Казалось бы, задача простая: смотришь на лидерборды, берешь лучшую, PROFIT. Но быстро выяснилось, что, во-первых, то, что прекрасно срабатывает на каких-нибудь английских юридических документах, может не потянуть такие штуки как научные формулы, паспортные данные и таблицы на русском языке. А во-вторых, даже если крутой по всем параметрам бенчмарк для оценки качества распознавания говорит, «всё прочитали правильно, я проверил», точность ответов пользователю, который совершает запрос к чат-боту с RAG под капотом, может страдать.
Как научить кодинг-модели не переписывать код заново
Не надо переписывать то, что не поломаноКод к этому посту доступен на Github.
Зелёные галочки лгут: почему AI пишет тесты, которые ничего не тестируют, и как это починить
Тесты зелёные, покрытие растёт, а багов меньше не становится. На QA-митапе инженер из крупной продуктовой компании показал механику: AI-агенты подгоняют моки, меняют ассерты, генерируют результаты, которые ничего не проверяют. Стек у команды — near-SOTA. Модель свежая. Агент — один из лидеров open-source.Значит, дело не в инструментах. А в чём именно — разбираю ниже: от кода до процесса и организации.Зелёные галочки лгутДокладчик описал паттерн, с которым сталкивался каждый, кто просил AI написать тесты:

