галлюцинации.

LLM уверенно называет шахматные ходы, которых на доске нет. Как я проверяю каждый ее ответ кодом

Движок знает ответ, но говорит числами: -2.7 и стрелка. Модель говорит словами, но врет. Первый же комментарий, который я получил, звучал так: «сильнее было 14.Nf6, конь врывается в лагерь черных». Коня, который может пойти на f6, в той позиции на доске не было.Сразу дисклеймер: это мой первый веб-проект. Я играю в шахматы блиц на 1300 и хотел инструмент, который объясняет мои ошибки словами, а не оценками. Часть того, что ниже, фронтендеру покажется очевидной. Мне пришлось выяснять это руками.

продолжить чтение

Как нейросеть переводит видео. Часть 1: Whisper врёт, и мы это знаем

Я делаю speeek.io, сервис дубляжа видео. Один. Код писал сам, с 2022 года, когда OpenAI выложил Whisper и я подумал: речь → текст → перевод → синтез → обратно на видео, делов-то. Делов оказалось на три года. В 2026-м через конвейер прошло 9 203 задачи, и он всё ещё ломается в тех же местах, что и в первый месяц. Просто теперь я знаю, в каких.

продолжить чтение

Отдал сайт ИИ‑агентам: из 111 находок аудита 25 пошли в мусор, 4 оказались выдумкой

Мой сайт ведут ИИ‑агенты. Они пишут код, правят тексты, проводят ревью, собирают и выкатывают. 207 коммитов.Я не буду рассказывать, как это ускорило работу — ускорило, это скучно и все уже слышали. Расскажу про то, о чём говорят реже: узкое место переехало с написания кода на его проверку. Агент производит правки быстрее, чем человек успевает их прочитать, и если не встроить проверку в конвейер, разница между «работает» и «выглядит как работает» перестаёт быть заметной.Две цифры для затравки:

продолжить чтение

Промпт — не контракт: замерил, как часто модель нарушает жёсткие правила, и вынес их в код

У меня в проде работает ИИ-консультант на сайте. У него есть два правила, которые нарушать нельзя вообще: не называть цены и не называть клиентов, которые под NDA. Оба правила были написаны в системном промпте капслоком, с объяснением почему.Я замерил, как они соблюдаются. Получилось так:правило «не называй цен» модель срывает примерно раз на восемь прогонов;имя клиента под NDA проскакивало раз на пять.

продолжить чтение

Апикальная гиперконтекстуализация. Почему мы можем чувствовать звуки на вкус и слышать звучание цвета?

Сам механизм открыт и описан в новом исследовании, и называется «апикальная гиперконтекстуализация». Он отвечает за то, как в нашем мозге возникает связь между всем, что находится в сознании. Способность связать несвязываемые вещи, людей и события. Чаще всего это проявляется при шизофрении или при злоупотреблении психоделиками. В чем новизна механизма?

продолжить чтение

Правильный код мы отклоняем — и так задумано

Работаю в компании «Сибинтек-Софт», занимаюсь поддержкой корпоративных информационных систем. Имею сертификат DevOps-инженера, в рамках задач отдела внедряю ИИ в рабочие процессы.Как-то мой валидатор забраковал ответ, сославшись на статью, которой не существует.

продолжить чтение

LLM не научились врать. Они научились говорить

LLM галлюцинирует, впрочем, все видели, как это выглядит. Модель уверенно, связно, с правильной интонацией и терминологией сообщает то, чего нет. Инженеры считают это багом, который чинят и  вот-вот починят.Не починят. Это не техническая ошибка, а неотъемлемое свойство языка, которое машина сделала видимым.Язык не нуждается в реальностиЯзык — уникальная система именно в том, что появляется из реальности, но для собственной связности в реальности не нуждается.

продолжить чтение

Жители Валдории живут 147 лет, а страна граничит с Германией и Японией одновременно. Исследование MiroFish. Часть 2

Вторая статья из трёх об исследовании MiroFish, открытого стека мультиагентной симуляции общества. В первой части изложены методология исследования и находка Silent Failure. В этой части: досье вымышленной страны с восемью классами заложенного абсурда, четыре байт-идентичных прогона с разными результатами и пре-регистрированный эксперимент, который локализовал причину.

продолжить чтение

Как не дать ИИ‑психологу поддакивать и галлюцинировать. Инженерный разбор safety‑обвязки

От автора. Здесь разбираю инженерную задачу safety‑обвязки ИИ‑психологов и привожу конкретные сервисы с рынка как примеры её решения. Проверяйте утверждения и спорьте в комментариях, я специально оставил открытый вопрос в конце.

продолжить чтение

Почему идеальная LLM всё равно не сделает агентные системы предсказуемыми

продолжить чтение

123456...7