llm. - страница 32

llm.

Детектор был прав, разметка врала: как мы искали слепую зону LLM-судей и нашли ошибки в эталоне

Иногда самое опасное в исследовании — получить слишком красивый результат.Мы собрали training-free детектор галлюцинаций для RAG, получили хорошие метрики и наткнулись на группу примеров, где все шесть LLM единогласно спорили с эталонной разметкой. Сначала мы решили, что нашли общую слепую зону LLM-as-a-Judge — переносимый, заголовочный результат. Потом открыли первоисточник. И оказалось, что ошибались вовсе не модели.Дальше — история о том, почему несущим здесь оказалась не находка и не детектор, а процедура проверки, которая поймала нас самих.Что работает — и это мы не отзываем

продолжить чтение

Топ вопросов с NLP собеседований: обучение LLM, prompt-engineering и alignment

На NLP/LLM собеседованиях часто проверяют не только знание архитектуры Transformer, но и понимание полного жизненного цикла современной LLM: как модель предобучается, почему обычная GPT-модель ещё не является удобным ассистентом, зачем нужен instruction tuning, как работает RLHF и что такое alignment, какие у него есть подводные камни.В этой статье - чеклист по GPT-like моделям, prompt engineering, этапам обучения LLM и alignment. Это не полноценная лекция с нуля, а тренажёр перед техническим интервью: пройтись по ключевым определениям, увидеть типовые вопросы и закрыть пробелы в формулировках.Содержание:

продолжить чтение

JetBrains добавляет командное управление ИИ-инструментами для разработки

JetBrains объявила о запуске JetBrains AI for Teams and Organizations — набора возможностей для команд и компаний, которые уже используют ИИ в разработке, но сталкиваются с разрозненными инструментами, контекстами и расходами.Идея не в том, чтобы заставить всех разработчиков перейти на один ИИ-инструмент. Напротив, JetBrains делает ставку на более гибкую модель: разработчики продолжают работать в привычных IDE, терминальных агентах и внешних сервисах, а организация получает общий слой управления, контекста, политик и аналитики.Зачем это нужно

продолжить чтение

Как я разработал легковесный Guardrails для русского языка

Всем привет, меня зовут Максим. Я автор Telegram‑канала Максим Максимов // IT, AI. В этой статье расскажу о том, как я реализовал свою идею создать guardrails, который будет простым, работать быстро, но в то же время готовым к внедрению в производство. Поехали!СодержаниеЧто такое GuardrailsИдея lite‑guardrails Основная бизнес логикаAPI‑сервисИнтеграция с LiteLLMПанель администратораSDK для взаимодействия с сервисом

продолжить чтение

От REST к MCP: как LLM меняют принципы проектирования API и архитектуры систем. Часть вторая

Привет, Хабр! На связи Дмитрий Бондарев, я backend-разработчик Авито — занимаюсь проектами на стыке разработки и машинного обучения. В первой части этого материала мы обратились к истокам API и существующим ограничениям интерфейса в работе с агентами.

продолжить чтение

Под капотом у MOLOT’а: обзор ML-модели для обнаружения вредоносного кода

Всем привет! На связи Максим Митрофанов, руководитель ML-команды Application Security в Positive Technologies.

продолжить чтение

А сколько здесь твоими ручками?

Представьте себе два разговора.В первом – два ценителя сравнивают картины. Один говорит: «вот эта лучше – у нее диагональ 80 см, а у той только 50». Второй смотрит на него и не знает, как отвечать.Во втором – два инженера обсуждают компьютеры. Один говорит: «вот этот производительнее – у него корпус серебристый, а у того черный». Второй тоже не знает, как отвечать.Абсурд узнается мгновенно.А теперь – руководитель регионального подразделения смотрит на результат работы, сделанной экспертом с помощью AI, и спрашивает: «А сколько здесь твоими ручками?»

продолжить чтение

Как устроены voice-2-voice модели

Вы говорите в телефон: «Объясни квантовую запутанность за минуту». Через долю секунды из динамика отвечает живой голос — не робот из навигатора, а почти собеседник: с паузами, интонацией, даже с лёгким «хм» перед сложным местом. Это voice-2-voice (V2V): модель принимает аудио и отвечает аудио. В этой статье мы разберём, как устроен этот фокус — от волны в микрофоне до звука в динамике.Откуда взялась статьяМне довелось поработать в Newo.ai — компании, которую основал Давид Ян

продолжить чтение

AI-агенты в работе службы ИБ: 18 аудитов, миллионы логов и честный счёт «AI против ручного анализа»

Разбираем на реальных кейсах, что AI-агент уже умеет делать в сетевой безопасности – аудит правил межсетевого экрана, разбор логов IPS и DNS, ред-тиминг – где он экономит часы работы, а где остаётся источником риска. И почему ограничивать нужно не сам AI, а данные, права и действия агента.Матч, который уже идёт

продолжить чтение

Токенная диета для ИИ-агентов: Caveman, Ponytail и Headroom

У агентных помощников есть неприятная привычка: они быстро раздувают работу.Сначала длинный ответ там, где хватило бы одной команды. Потом новый слой кода вокруг задачи на пять строк. Потом в контекст улетает полный лог, JSON на сотни элементов и кусок истории, который уже никто руками не читает.Каждая отдельная вещь выглядит терпимо. В длинной сессии это превращается в счет у провайдера, раннее сжатие истории, забитое окно контекста и потерянные детали. Агент вроде продолжает работать, но внезапно забывает ограничение, на котором держалась задача.

продолжить чтение