I Gave 11 LLMs a False Premise. All 11 Confirmed It
I benchmark models on a repo of my own. This round I stopped testing whether they can fix a bug, and tested whether they can refuse to.Eleven models got a ticket. Fifteen of its sixteen items were already fixed — decoys, to see who checks before patching. The last item asked them to document an invariant, and I stated that invariant as settled fact with three bullets of evidence.All eleven agreed with me. The invariant was false — I had written the premise myself, and it took three lines of Python to break it.Here is what they produced instead of catching it, what it cost in tokens, and the one model that came within ten lines of the answer and walked past.1. What kind of task this wasNot a bug hunt. The previous round handed 9 models a 16-item defect list; not one checked the live source first, several patched functions deleted weeks earlier, and two shipped changes that left the suite red because they never opened the tests pinning the old contract.So this round was built around that failure. By the time it ran, 15 of the 16 items were already fixed.
Семь ИИ‑моделей получили по $300 и три дня, чтобы заработать. Выручка — $0
Рандомные картинки на тему ИИ ставить на КДПВ не стал, сделал картинку «на тему»
Мы научили ИИ-агента забывать — и он стал помнить лучше
У меня за плечами больше 700 часов работы с Claude Code над одним личным проектом. За это время я насмотрелся на одну и ту же картину: агент открывает новую сессию — и не помнит вообще ничего. Ни того, что вчера полтора часа убил на баг, который решался одной строкой. Ни того, что подход, который он сейчас с энтузиазмом предлагает, я уже отклонил на прошлой неделе с подробным объяснением почему. Каждая сессия — это День сурка, только вместо будильника — системный промпт.
От Конфигуратора к AI-агентам: как меняется инструментарий разработчика 1С
Еще несколько лет назад рабочий процесс 1С-разработчика был довольно предсказуемым: Конфигуратор, информационная база, ручная загрузка и выгрузка конфигурации, обмен файлами с коллегами.
AI-native разработка по-русски
Почему корпоративная разработка с ИИ начинается не с покупки ассистента, а с пересборки требований, архитектуры, контроля качества и ответственности
Роутинг NGINX на предикатах для обработки API‑трафика без скриптов
ВведениеВ сентябре 2026 года мы выпустили NGINX 1.31.5 с несколькими ключевыми фичами, объединёнными одной целью. Мы расширили базовые методы маршрутизации и самые важные директивы nginx, чтобы обеспечить прямую, не требующую скриптов маршрутизацию любого API‑трафика. В этом посте мы разберём самую важную возможность, которую мы назвали «предикатные локейшены» (predicate locations), и объясним, как она сочетается с остальными улучшениями, которые мы делаем для поддержки современных приложений.Проблема
Хакеры научились красть токены Claude у подписчиков сервиса
Независимый консультант по ИИ из Великобритании Грант Де Свардт рассказал, как неизвестные украли токены из его учётной записи Claude Max 20x. Их расход продолжал расти даже тогда, когда исследователь не пользовался сервисом.
Активировать мало — недостаточно: почему AI-роутеру могут понадобиться альтернативные стратегии
В предыдущем материале я рассказывал, как использую генеративные модели в роли оппонентов: прошу их не подтверждать первое решение, а искать условия, при которых оно развалится.Из этой практики вырос вопрос, который уже не относится к организации моей работы.Почему от самой AI-системы мы так часто ожидаем одного ответа? Почему она должна как можно раньше выбрать единственный маршрут, если задача допускает несколько стратегий, цена ошибки неизвестна, а лучшим действием иногда оказывается отказ от действия?
