LLM не научились врать. Они научились говорить
LLM галлюцинирует, впрочем, все видели, как это выглядит. Модель уверенно, связно, с правильной интонацией и терминологией сообщает то, чего нет. Инженеры считают это багом, который чинят и вот-вот починят.Не починят. Это не техническая ошибка, а неотъемлемое свойство языка, которое машина сделала видимым.Язык не нуждается в реальностиЯзык — уникальная система именно в том, что появляется из реальности, но для собственной связности в реальности не нуждается.
Жители Валдории живут 147 лет, а страна граничит с Германией и Японией одновременно. Исследование MiroFish. Часть 2
Вторая статья из трёх об исследовании MiroFish, открытого стека мультиагентной симуляции общества. В первой части изложены методология исследования и находка Silent Failure. В этой части: досье вымышленной страны с восемью классами заложенного абсурда, четыре байт-идентичных прогона с разными результатами и пре-регистрированный эксперимент, который локализовал причину.
Как не дать ИИ‑психологу поддакивать и галлюцинировать. Инженерный разбор safety‑обвязки
От автора. Здесь разбираю инженерную задачу safety‑обвязки ИИ‑психологов и привожу конкретные сервисы с рынка как примеры её решения. Проверяйте утверждения и спорьте в комментариях, я специально оставил открытый вопрос в конце.
AI‑тренер по CS2 на DeepSeek: где LLM выдумывает и почему семь недель стоили $1,45
Всем привет. Я много лет играю в Counter‑Strike и тренируюсь, как большинство: захожу в Deathmatch «размяться», играю три катки, тильтую, выхожу. Сервисы статистики при этом исправно сообщают, что у меня просела точность и выросло время реакции. Спасибо, а делать‑то что?
Квантование ломает вызов инструментов не так, как показывает BFCL: проверил на MCP-серверах
Есть простая практическая задача, из-за которой я вообще все это затеял. Вы берете маленькую модель, квантуете ее, чтобы она влезла в ноутбучную видеокарту, и хотите заранее понимать, насколько просядет ее способность вызывать инструменты. Обычно для этого смотрят на BFCL или ToolACE: там все измерено, есть таблицы, есть готовые цифры деградации по уровням квантования. И кажется логичным, что этими цифрами можно пользоваться.
Когда ИИ-агент ошибается молча: 6 отказов, которые не видно по ответу
ИИ-агент — не чат-бот. Чат-бот генерирует текст. Агент совершает действия: читает документ, решает, какие инструменты вызвать, выполняет многошаговый рабочий процесс и выдает результат, на основании которого без дополнительной проверки действуют системы-потребители — а иногда и люди.Когда агент составляет ответ, цена ошибки — неудачный абзац. Когда он одобряет кредит, подает регуляторную отчетность или запускает эскалацию, ошибка может обернуться операционными, финансовыми или репутационными потерями.
Декодирование в LLM как эволюция стратегий
Привет, Хабр! Меня зовут Андрей Бирюков. Я — независимый эксперт в области ИТ и ИБ, преподаю в учебных центрах и пишу статьи и книги. Мы привыкли оценивать большие языковые модели
Все демонические насельники ИИ… по старшинству
Гоблины, призраки, монстры, богини: фантастические твари и где они обитают.В конце апреля OpenAI опубликовала у себя в блоге пост, в котором объяснила, почему модели OpenAI то и дело говорят о гоблинах. А также о гремлинах.
Когда чат-бот продаёт Chevrolet за доллар: как тестировать и мониторить LLM-приложения
Генеративные модели разблокировали огромное количество новых продуктов и новых фич в уже существующих. Поиграться с ними успел, кажется, каждый. И сценарий почти всегда повторяется: команда быстро собирает прототип на внешнем API, выкатывает его в продакшен, продукт начинает приносить ценность, а вместе с ценностью приходит и тревога. Работает ли всё так, как мы ожидали? В этот момент хочется уже не угадывать, а измерять.Эта статья про то, как измерять. Точнее, про то, как тестировать и мониторить адаптивные LLM-системы в продакшене и до него, чтобы убедиться: ассистент ведёт себя так, как задумано.Что именно мы оцениваем

