Все числа на месте, а смысл изменился: как проверять правки ИИ
Анна получила 30 000 рублей. Борис получил 50 000 рублей.После редактуры:Анна получила 50 000 рублей. Борис получил 30 000 рублей.Оба имени на месте. Обе суммы тоже. Только деньги достались не тем людям.Это нарочно грубый пример: ошибку видно сразу. Но если проверять текст по списку сохранившихся имён и чисел, придраться не к чему. Именно поэтому ответ «факты сохранены» требует уточнения: что проверка считает фактом?Я развиваю humanizer-ru
Запустить LLM локально: что считать до покупки видеокарты?
Всем привет, меня зовут Сергей Прощаев, я Tech Lead и руководитель направления Java/Kotlin‑разработки в FinTech & E‑commerce, преподаю на курсах разработки и архитектуры в ОТУС.В этой статье расскажу про домашний стенд для локального инференса
«Ты же говорил, что так можно»: как ИИ помогает в 1С бухгалтерам и руководителям
Читала недавно статью про то, что бухгалтер может использовать ИИ для ответов на требования — в комментариях много шуточек про то, что с такими ответами ты потом будешь за решеточкой сидеть (и то правда)). К сожалению, наши законы написаны так, что их действительно нужно читать между строк, и не раз — чтобы понять реальный смысл со всеми возможными подводными камнями, но статья не об этом.
Кредитный радар: LLM-воркфлоу, который каждое утро читает условия 12 банков и сам проверяет свои числа
TL;DR. Собрал воркфлоу на языковой модели, который раз в сутки обходит 34 страницы условий у 12 российских банков, сравнивает их со вчерашним снимком и публикует сводку изменений с ссылкой на источник в каждой строке, а при изменении цены пишет разбор с расчётом. Модель вызывается в четырёх точках и ни в одной не решает, что делать дальше. Цитаты, числа и статистика проверяются кодом. Каждый выпуск оценивается по 14 бинарным проверкам, метрики публичные. Стоит от 3 центов до 70 в день. Ниже устройство, проверки, evals и что он нашёл за первую неделю.
Как проверяющий ИИ испортил правильные ответы: разбор генератора учебных заданий
В задании на сортировку было слово «маши…ый». Генератор положил его в корзину «Две НН», и это верно. Проверка переложила слово в корзину «Одна Н». Вот ответ модели-арбитра, после которого это случилось, без правок, из сохранённого JSON:{ "n": 4, "a": "Одна Н", "why": "Прилагательное от «машина» с суффиксом -н-: корень оканчивается на н? Нет — «машин-» + -н- даёт «машинный»? В школьной норме пишется «машинный» (две НН), но по данному заданию основа «машин»+н… — фактически верно «машинный»." } Ответ в поле a неверный, а в объяснении модель сама приходит к «машинный». Код читал только a.
Google выкатила Gemini 3.8 Live и версию с рассуждениями
15 сентября Google представила
Как устроен RAG для юридических документов и почему одной LLM оказалось недостаточно
Первый вариант системы выглядел вполне стандартно: документы разбиваются на фрагменты, для них считаются embeddings, пользователь задаёт вопрос, несколько наиболее подходящих фрагментов отправляются в LLM вместе с запросом. Модель формулирует ответ — на первых тестах этого было достаточно.Проблемы начались на вопросах, которые на первый взгляд мало чем отличаются друг от друга:Какая пеня установлена в договоре № 14/24.7645?Кто из арендаторов не заплатил за май?А у него предусмотрена индексация?Контрагент предлагает добавить пеню в 0,01%. Насколько это существенно?
Диффузионная LLM технически умеет глушить свой контекст. Я попробовал этим воспользоваться
У авторегрессионной модели контекст — это то, что уже случилось. Токен выдан, и переписать его нечем: генерация умеет только дописывать справа.У диффузионной всё иначе. На каждом шаге она делает полный двунаправленный проход по всей последовательности и переоценивает каждую позицию. Решение «эту фиксируем, эту оставляем открытой» принимает встроенный механизм уверенности: прошёл максимум softmax порог — токен приморожен, не прошёл — остаётся маской и будет переписан. То есть у диффузионной модели структурно есть

