kimi.
Квадриллион параметров (1Q) для LLM. Когда нам ждать такую модель?
Согласно закону заголовков Беттериджа («Если заголовок заканчивается вопросительным знаком, на него можно ответить „нет“»), ответом на вопрос в заголовке будет „никогда“. И я попытаюсь вас в этом убедить.
Kimi K3 — что реально даёт открытие весов самой большой модели
27 июля Moonshot AI выложила веса Kimi K3 — модели на 2,8 трлн параметров, которая до этого работала только через платный API. Вместе с весами открыли технический отчёт и три внутренних инструмента, на которых модель обучали.
Ответ на Kimi K3: зачем Alibaba выкатила 2,4-триллионную Qwen3.8
На конференции WAIC в Шанхае Alibaba представила Qwen3.8 — новую мультимодальную модель на 2,4 трлн параметров. По заявлению компании, архитектура уступает по производительности только Claude Fable 5, хотя независимых бенчмарков пока нет.
Вайбкодинг на минималках: как настройка OpenClaw убила веру в магию нейросетей (или история дефолт-юзера с openclaw)
ОГЛАВЛЕНИЯ:ВВОДНАЯ ЧАСТЬОЖИДАНИЕ ОТ ПРОГРАММЫПЕРВАЯ УСТАНОВКАСТОИМОСТЬ И ИСПОЛЬЗУЕМЫЕ МОДЕЛИ
Прогнал 6 апрельских LLM через battle test. Победил не самый новый и не самый дорогой
DeepSeek V4 Pro вышел 24 апреля 2026, три дня назад. Огромная модель, топ AIME и SWE-bench, передовая reasoning-архитектура. Вокруг релиза до сих пор много шума — пиарили мощно. Я открыл OpenRouter, прописал её в свой battle test и ждал Tier S — 95+ из 100 на длинном русском контенте.Получил 89. Tier A, нижний край. Ну ладно — подумал, что модель прогрелась криво, и через сутки прогнал второй раз. Ровно 89. Не статистический выброс, а воспроизводимый результат.Запустил его же Flash-вариант — 83. По чистому качеству Pro действительно сильнее, на 6 пунктов. Только Flash при этом стоит $0.0019 за вызов против $0.0256 у Pro. В 13 раз дешевле.
Как научить кодинг-модели не переписывать код заново
Не надо переписывать то, что не поломаноКод к этому посту доступен на Github.
Я vs. машина
Прошёл примерно год с тех пор, как я начал активно использовать Claude Code для разработки, и, как я уже писал, это существенно изменило мои рабочие процессы. Продуктивность действительно выросла — но в основном по ощущениям, а они у меня примерно такие же надёжные, как мои эстимейты (то есть никакие, и лучше не станут). Так что я решил, что пора проверить своё чутьё абсолютно научно пуленепробиваемым способом (со статистически высокозначимой контрольной группой из меня, себя и моей собственной персоны).Эксперимент, о котором никто не просил
«Героиня прикована к полу, но спускается по лестнице»: разбираем логику ИИ-писателей
Леч Мазур добавил три модели в свой бенчмарк по оценке навыков написания коротких рассказов. Kimi K2.5 — 8,07 балла, Qwen3 Max — 7,84, MiniMax-M2.1 — 7,78. Результаты неплохие, но самое ценное в этом бенчмарке — не цифры, а разбор конкретных ошибок.Если вы используете ИИ для текстов, вот на что стоит обращать внимание при проверке.Физическая непрерывность. Героиня «прикована к полу кандалами», через абзац спускается по лестнице, а цепь «остаётся наверху». Модели хорошо держат локальный контекст, но теряют детали на длинной дистанции.

