BrainTools - Методики для развития мозга - страница 119

ОК или НеОК: как мы строили LLM‑судью и дважды меняли формулу вердикта

У нашего AI‑агента поддержки было десять метрик и ноль ответов на главный вопрос: какую долю обращений он решает?Судья, который читал только текст диалога, ставил 18/20, а проверка по реальным вызовам инструментов давала 8/20. Текстовые проверки считали правдоподобный ответ верным и не могли отличить его от подтвержденного. Самодельный «процент фантомных эскалаций» оказался измерением того, насколько слова бота согласованы с его же внутренними флагами. Каждая метрика что‑то измеряла, и ничего продуктового

продолжить чтение

Google зарегистрировала в ещё РФ четыре товарных знака

Google зарегистрировала в РФ четыре товарных знака — название AlphaEvolve и логотипы Google Meridian, AI Edge Gallery и ещё одного сервиса, о котором нет данных в открытых источниках. По информации

продолжить чтение

Как я измеряю видимость брендов в шести нейросетях: схема замера, формат логов и ошибки

Задача звучит просто: выяснить, называют ли бренд ChatGPT, Claude, Perplexity, Gemini, Алиса AI и GigaChat, когда пользователь спрашивает совета или ответа у ИИ. На практике эта задача раскладывается на десятки технических решений, каждое из которых меняет результат в разы. Ниже устройство замера, формат хранения и три моих ошибки, которые обесценивают всю работу.Замер строится на неподсказанных запросах, а не на названии брендаВопрос «что такое компания N» проверяет, знает ли модель название. Для оценки видимости он бесполезен: клиент так не спрашивает.

продолжить чтение

Собираем Скайрим 2.0 — лучшие моды в ожидании TES 6

Анонс The Elder Scrolls 6 состоялся в далеком 2018 году, но игра-по-прежнему находится в активной стадии разработки

продолжить чтение

ГигаАгент от Сбера. Первый блин слопом

12 августа Сбер выпустил своего первого универсального ИИ-агента. Новость эта стала федерального уровня, т.к. про неё написал ТАСС! Более того, было заявлено, что это “первый в России автономный универсальный ИИ-агент”. Как основатель компании, которая запустила ИИ-агентов в феврале этого года на своем ядре, мне конечно же стало интересно протестировать решение от Сбера. Более того, в апреле этого года мы получили Грант от Яндекса на миллион рублей на токены моделей ИИ, и с этого месяца мы сделали поддержку моделей Alisa Ai LLM и Yandex GPT Pro, но это тема для отдельного поста.

продолжить чтение

Философия мультивселенной

продолжить чтение

Train и eval в ARC-AGI-2 — это разные распределения

Train и eval в ARC-AGI-2 лежат в разных распределенияхЕсли вы замеряете прогресс своего солвера на случайной подвыборке из train, вы замеряете его не на том наборе. Медианная задача train занимает 100 клеток на выходе, у медианной задачи eval их 225. Два и более тестовых входа требуют 6.9 процента задач train и 40.8 процента задач eval. Расхождение держится по всем шести структурным осям, которые я померил, и переживает поправку на множественные сравнения.

продолжить чтение

Зрелость внедрения ИИ и зрелость информационной безопасности ИИ

Две зрелости – внедрения ИИ и его защиты – почти никогда не совпадают, и именно зазор между ними даёт большинство инцидентов и претензий регулятора. В статье приведём обе оси к единой шкале CMMI, покажем, как организации проходят узнаваемые состояния (от отрицания до бесконтрольных агентов), и свяжем всё это с Приказом ФСТЭК № 117 и российскими стандартами.1. Зачем измерять две зрелости

продолжить чтение

Миллионы обращений, контент для ИИ и зарплата-загадка: как московские власти ищут шеф-редактора базы знаний

Картинка сделана с ИИ. Все совпадения случайныГКУ «Инфогород», которое работает с цифровыми проектами ДИТ Москвы, ищет специалиста

продолжить чтение

Нейросети для учителей 2026: топ-5 курсов для педагогов

продолжить чтение