Детектор был прав, разметка врала: как мы искали слепую зону LLM-судей и нашли ошибки в эталоне
Иногда самое опасное в исследовании — получить слишком красивый результат.Мы собрали training-free детектор галлюцинаций для RAG, получили хорошие метрики и наткнулись на группу примеров, где все шесть LLM единогласно спорили с эталонной разметкой. Сначала мы решили, что нашли общую слепую зону LLM-as-a-Judge — переносимый, заголовочный результат. Потом открыли первоисточник. И оказалось, что ошибались вовсе не модели.Дальше — история о том, почему несущим здесь оказалась не находка и не детектор, а процедура проверки, которая поймала нас самих.Что работает — и это мы не отзываем
Нейросеть-автопилот вместо 400 Playwright-тестов
Продолжаю цикл статей из мира соло-разработки больших систем.Первый месяц создания игры - медовый. Баги видны почти сразу, работа спорится. Но потом начинается настоящая работа. Баги становятся очень неприятными, когда ты находишь их после двух часов игры.Например, когда на 1066-й день игры внезапно рушится экономика.К этому моменту мне и самому надоела рутина - голыми руками проходить сценарии, и я начал искать способ как подрядить на это нейронку.
Подводные камни Learned Motion Matching: опыт реализации
Автор: Георгий Маркелов, разработчик SoftellionВ прошлой статье я сделал обзор на существующие на данный момент методы реализации анимации персонажей с применением машинного обучения. Однако существует ряд нераскрытых приемов, без которых финальный результат будет неудовлетворительным. В этой статье я поделюсь опытом реализации Learned Motion Matching.ПредисловиеВсе формулы справедливы для левосторонней (left‑handed) системы координат:
Как на самом деле работают LLM
В статье подробно рассматриваются принципы работы больших языковых моделей (large language model, LLM). Поскольку в основе большинства современных LLM лежит архитектура трансформера (transformer), ее понимание дает представление о ключевых механизмах, обеспечивающих работу таких моделей.В этой статье мы разберем ключевые принципы работы современных LLM, построенных на архитектуре трансформера. Я постараюсь объяснить основные идеи без погружения в сложную математику. Конечно, для глубокого понимания темы математическая база важна, но для первого знакомства этого материала должно быть достаточно.
Переоценённый король
Почему ИИ-индустрия платит «налог на Python» — и как быстрые компилируемые языки, в частности, Swift, открывают ей новые горизонтыАндрей СапуновДисклеймер: это мнение автора. Автор — заинтересованная сторона: он ведёт открытый проект языковых моделей на Swift/MLX (swift-language-models) и написал книгу, весь код которой — на Swift. Читайте с поправкой на этот конфликт интересов. В качестве противовеса каждое число в статье снабжено ссылкой на первоисточник, а сильнейшим контраргументам отведён отдельный раздел 8.Аннотация.
Как я запустил перцептрон на обычном непрограммируемом калькуляторе Casio
Всем привет, это моя первая статья на Хабре и я решил посвятить ее своему недавнему мини‑проекту, сутью которого является обучение небольшого перцептрона 2-5-1 с помощью Python без сторонних библиотек (типа NumPy), и его последующий инференс на непрограммируемом инженерном калькуляторе Casio‑Fx-82-Es Plus (2nd edition). В качестве задачи для перцептрона я выбрал определение того, находится ли точка в пределах графика следующей лемнискаты Бернулли: (x² + y²)² — 2a²(x² — y²) = 0 (с a = sqrt(0.5), то есть вообще без коэффициента 2a²), с минимально приемлемой вероятностью (70–85%)
Умеют ли трансформеры водить машину
Трансформеры уже умеют писать код, генерировать тексты и рисовать картины. Но могут ли они управлять автономным автомобилем в реальных городских условиях, среди людей и других машин?

