llm. - страница 98

llm.

Вышла флагманская open-source модель GLM 5.2. Уже доступна в KodaCode

Компания Z.ai представила GLM 5.2 — новую флагманскую модель семейства GLM, ориентированную на long-horizon задачи: системную разработку, большие кодовые базы, сложный дебаг, оптимизацию производительности и длительные агентные сценарии.

продолжить чтение

Ни одна ошибка не нова: почему провал ИИ в First Proof был предсказуем заранее

В начале июня 2026 вышли результаты First Proof Second Batch — первого бенчмарка, который одновременно: (1) состоит из исследовательских задач, (2) заведомо не встречавшихся в обучающих данных, и (3) проверяется живыми математиками вслепую по правилам журналов.Заголовки привычно написали: «ИИ провалил тест по математике». Но самое интересное в отчёте — не счёт, а то, что ни один тип ошибок не нов. Каждую можно было предсказать заранее из классических работ о математическом мышлении и надёжности проверок. Если сложить эти источники, результаты First Proof перестают удивлять.

продолжить чтение

RAG от А до Я: шпаргалка архитектора (векторные базы, чанкинг, реранкинг и 8 граблей продакшена)

Это же так легко

продолжить чтение

Работает ли Caveman? Тестируем модный скилл для экономии токенов

Недавно копайлот перешёл на новую тарификацию, из-за которой я упёрся в месячные лимиты буквально за первую рабочую неделю. В рабочих чатиках все стали искать способ экономить токены, и среди разных предложений стабильно мелькал скилл под названием Caveman.Что он обещает? Идея простая — скилл указывает нейронке говорить, как пещерный человек, убирать артикли, говорить коротко и думать лаконично. На первых строках README обещается экономия до 75%. При этом без потери качества!

продолжить чтение

Почему ИТ превращается в гуманитарную науку

продолжить чтение

Кому с AI жить хорошо

Если раньше казалось, что эй-ай заменит разработчиков, то теперь кажется, что всё даже веселее складывается. И я всё чаще задумываюсь, что очень задорно по нам, программистам, катком пост-иронии проехалось.Ахтунг! Мнение Олега может не совпадать с мнением Громова. Вас предупредили, продолжайте на свой страх и риск.Кому жить хорошоВот смотрите сами. Раньше не умел дизайнер на джаваскрипте менюшку верстать, и ему приходилось с разработкой дружить, шутки про Шелдона на обеде слушать. Или эйч-ти-эм-эль учить по вечерам, что ещё хуже.Теперь claude

продолжить чтение

LLM, персональные данные и 152-ФЗ

Зачем это вообщеLLM и агенты по типу Codex, Claude Code и т.д. изначально задумывались и использовались для работы с кодом.

продолжить чтение

LLM собрала IndexedDB с нуля: 1208 тестов, SQLite и несколько неприятных сюрпризов

TL;DR: одним промптом я реализовал IndexedDB с помощью Claude Code и Ralph loop: получилось пройти 95% целевого подмножества Web Platform Tests и 77,4% более строгого набора тестов.Когда я узнал, что два простых браузерных движка были написаны с помощью вайб-кодинга, я не особенно удивился. Браузерный движок — хорошо изученная задача с несколькими независимыми реализациями, а их кодовые базы наверняка давно попали в обучающие данные LLM.Удивило меня другое: похоже, ни один из проектов по-настоящему не использовал Web Platform Tests

продолжить чтение

Prompt injection нельзя запатчить: год «летальной триады» и лента CVE 2026 года

В марте 2026-го бэкдор пролежал на PyPI около трёх часов. За это время заражённый пакет скачали почти 47 тысяч раз. Пакет назывался LiteLLM — это шлюз к языковым моделям, на котором держатся CrewAI, DSPy, Microsoft GraphRAG и ещё десятки агентных фреймворков. Тот, кто за эти три часа обновлял зависимости, вместе с обновлением затащил к себе автономного бота-атакующего по имени hackerbot-claw.

продолжить чтение

Deep Research как управляемый исследовательский контур

Написано в соавторстве с @bear7

продолжить чтение