Один суффикс, чтобы взломать их всех
От GCG до refusal direction. Лонгрид о серии градиентных adversarial-атак на языковые модели: с чего она началась, как разветвилась, что мы в итоге поняли про механику взлома и где находимся сейчас.О чем это и зачемЕсть простой, но неудобный вопрос: насколько прочен safety-элайнмент, который мы навешиваем на модели? Интуиция подсказывает: «модель обучили отказывать на вредное - значит, она отказывает». Серия работ, которую я хочу разложить, показывает, что между обучили отказывать и робастно отказывает под давлением оптимизации - пропасть.
Срочная новость: правительство США потребовало экстренно отключить доступ к Fable 5 и Mythos 5
Правительство США, ссылаясь на полномочия в сфере национальной безопасности, выпустило директиву экспортного контроля, требующую приостановить любой доступ к Fable 5 и Mythos 5 для иностранных граждан - независимо от того, находятся они в США или за их пределами. Это касается в том числе иностранных сотрудников Anthropic.Практический результат этого распоряжения: нам необходимо срочно отключить Fable 5 и Mythos 5 для всех наших клиентов, чтобы обеспечить соблюдение требований.Доступ ко всем остальным моделям Claude не затронут.
Почему мы спорим о памяти для AI-агентов
ВведениеНа днях читал статью про память для AI-агентов — одну из тех, где рядом мирно уживаются SQLite, экономия токенов, поиск по накопленным знаниям и надежда наконец перестать кормить модель одними и теми же простынями контекста при каждом новом запуске.
Как пересмотр теории выученной беспомощности меняет концепцию баз знаний?
Как нам всем иногда не хватает такого "решателя проблем" мистера Вульфа!
RPA умер
Рынок RPA умер — парадигма корпоративной автоматизации сместилась в сторону Agentic AIАвтор: Деон ван Никерк, технический директор Ovations TechnologiesБолее десятилетия роботизированная автоматизация процессов (RPA) была лицом автоматизации. Она приносила ощутимую пользу: автоматизировала повторяющиеся задачи, сокращала ручной труд и давала организациям время на модернизацию основных систем.Но сегодня становится очевидной фундаментальная истина: RPA, как стратегическая парадигма автоматизации, мертва.
Неделю назад они говорили что ИИ опасен. А потом подняли свой же потолок
Среда, утро, кофе. Открываю Хабр, мельком вижу заголовок «Антропик предупреждает что ИИ становится слишком опасным, индустрии надо тормозить». Знакомая песня, Амодей это говорит регулярно, последние года полтора почти на каждом выступлении. Прокрутил, пошёл дальше.В пятницу открываю docs Антропика чтобы дёрнуть пару параметров API для одного клиентского проекта. На главной баннер. Файбл 5. Новый класс Mythos. Релизнули.Так.
Самая опасная ошибка AI‑агента — не плохой код
ПредысторияДавеча я обсуждал в агентской сессии, почему старая задача перестала находиться после переименования проекта. Ситуация выглядела достаточно простой: у задачи был стабильный идентификатор, проект когда‑то назывался иначе, а текущий механизм поиска, судя по всему, продолжал учитывать не только идентификатор задачи, но и имя проекта, которое давно изменилось. Агент быстро подтвердил проблему, нашёл место, где точечный поиск всё ещё зависел от имени проекта, сформулировал вполне разумную гипотезу исправления, после чего начал читать код, менять несколько файлов и добавлять тесты.
Что такое контекстное окно и почему модели забывают
Ты час разговариваешь с ChatGPT. Даёшь контекст, объясняешь задачу, уточняешь детали. А потом модель вдруг начинает противоречить тому, что говорила раньше. Забывает имя персонажа которое ты указал в самом начале. Спрашивает то, о чём вы уже договорились.Первая реакция - что-то сломалось. Но это не баг. Это фундаментальное ограничение архитектуры, у которого есть название и объяснение.Модель не помнит - она читаетГлавное заблуждение про языковые модели - что у них есть память. Что где-то внутри хранится история ваших разговоров, и модель к ней обращается.Это не так.
Пять LLM-провайдеров через один openai-клиент
У нас почти каждая заметная операция в продукте идёт через LLM: генерация follow-up, сборка КП, скоринг, саммари звонков. Пока провайдер один — это бомба замедленного действия. Он ложится по 503, упирается в рейт-лимит, или цена улетает, потому что дешёвый разбор команды почему-то крутится через флагманскую модель.Поэтому мы сделали тонкий роутер. Не фреймворк, не «оркестратор агентов» — примерно 500 строк на NestJS, которые переезжают между нашими продуктами без правок. Расскажу, что внутри и на чём набили шишки.Один клиент вместо зоопарка SDK

