llm.
Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов
Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard, о которых и пойдет речь в этой статье.
Почему нельзя просто загрузить историю с фитнес-браслета в LLM и попросить оценить здоровье
Исследователи из Meta и KAIST решили проверить очевидный на первый взгляд вопрос: если дать большой языковой модели реальную историю измерений с фитнес-трекера — пульс, сон, шаги за полгода — сможет ли она разобраться в этих данных так же уверенно, как рассуждает о здоровье вообще? Результат оказался неожиданным. Модели гораздо хуже справлялись с простыми вычислениями по самим цифрам, чем с клинической интерпретацией того же ряда. GPT-4o правильно считал тренды и аномалии лишь в четверти случаев, а вот рассуждал о рисках для здоровья на основе тех же данных вдвое увереннее.
Давай по новой, Миша: speculative decoding от черновика до проверки
Маленькая модель быстро генерирует несколько следующих токенов, а большая проверяет их сразу одной пачкой. Подходящие токены принимаются, а с первого расхождения большая модель продолжает генерацию сама. При корректной реализации итоговое распределение остаётся тем же, что и при обычном декодировании. В speculative decoding большая модель буквально говорит черновой: «Давай по новой, Миша».На первый взгляд кажется, что ускорение здесь обязательно покупается ценой качества. Но нет: это как раз тот случай, когда можно ускорить генерацию без такого компромисса.
Промпт — не контракт: замерил, как часто модель нарушает жёсткие правила, и вынес их в код
У меня в проде работает ИИ-консультант на сайте. У него есть два правила, которые нарушать нельзя вообще: не называть цены и не называть клиентов, которые под NDA. Оба правила были написаны в системном промпте капслоком, с объяснением почему.Я замерил, как они соблюдаются. Получилось так:правило «не называй цен» модель срывает примерно раз на восемь прогонов;имя клиента под NDA проскакивало раз на пять.
Как я понял, что делаю x16 на Cursor — и почему убрали цену
Холмс, у меня к вам дело, и начинается оно, как все скучные дела, с бухгалтерии.Я плачу за Cursor $60 в месяц. На днях я открыл страницу расходов, чтобы посмотреть, много ли я потратил за неделю, и обнаружил, что смотреть там абсолютно не на что. Вижу 321 запрос, и напротив каждого — слово «Included», то есть «включено», и ни одной суммы.Сначала я решил, что это глюк сайта. Потом выяснил, что нет: цифры убрали намеренно, полтора месяца назад, и компания объяснила, почему. Объяснение взволновало меня. Доллары в реальных расходах часто оказывались больше, чем стоит сам план, и это смущало людей.
Как я строю нейросимвольное извлечение условий из тендерных документов
Почему лучший кандидат не всегда правильный Рабочее название прототипа: Tender Semantic Engine (TSE)Если фрагмент оказался неправильным ответом на один вопрос, сначала стоит проверить, не является ли он правильным ответом на другой.Задача, которая только кажется простойЯ разрабатываю настольную систему для работы с тендерами. Один из ее модулей должен читать комплект закупочной документации и переносить в карточку тендера конкретные условия: порядок оплаты, аванс, срок и место поставки, гарантию, обеспечение, штрафы и другие обязательства сторон.
Xiaomi MiMo v2.6 pro с ноги открывает дверь
Некогда объяснять©Хорошая заявка на победу©https://artificialanalysis.ai/models/mimo-v2-6-proПодписки имеютсяhttps://mimo.mi.com/docs/en-US/tokenplan/Token%20Plan/subscription
Как устроены LLM: разбираем на примере 3-уровневой абстракции
Чтобы оптимизировать производительность больших языковых моделей (LLM), необходимо понимать весь программный стек. Мне не удалось найти подробную статью, которая показывала бы этот стек как общую картину, поэтому я решил написать такую статью сам. Эта статья не является исчерпывающим обзором или набором наилучших практик. Здесь я в большей степени делюсь моими общими представлениями о том, как выглядит ландшафт современных LLM‑систем.Во‑первых, любая система проектируется с расчётом на достижение конкретных целей с учётом заданных ограничений. В LLM‑системах наиболее принципиальные цели связаны с увеличением
Код быстрее, проверок больше: как ИИ меняет DevSecOps
Всем привет!В конце августа мы провели по ИИ в безопасной разработке и решили собрать в этом материалы основные тезисы наших экспертов. Тема - горячая, важная, поэтому добро пожаловать в комментарии!Итак, начинаем разбираться, как ИИ меняет безопасную разработку вместе с Антоном Прокофьевым, директором центра разработки решений по контролю безопасности ПО ГК «Солар»; Дмитрием Евдокимовым, основателем и генеральным директором Luntry; Дмитрием Частухиным, основателем и техническим директором Hexway.

