тестирование LLM.

7 ошибок в оценке качества LLM‑систем в продакшене

Всем привет, меня зовут Сергей Прощаев и в этой статье расскажу про то, как команды теряют контроль над качеством своих LLM‑фич и что с этим делают инженеры, у которых это работает.Я Tech Lead и руководитель направления Java | Kotlin разработки в FinTech & E‑commerce и преподаю на курсах разработки и архитектуры в ОТУС.

продолжить чтение

Сможете ли вы найти пять ошибок в Python‑коде, который вызывает LLM

Привет, Хабр! Вызов языковой модели давно стал обычной строчкой в любом коде. Классификация тикетов, разбор писем, извлечение полей из накладных, генерация описаний для каталога — всё это пишется в три строки: импортировали клиент, отдали промпт, забрали response.choices.message.content. Библиотеки удобные, документация подробная, туториалов вагон.

продолжить чтение

Когда чат-бот продаёт Chevrolet за доллар: как тестировать и мониторить LLM-приложения

Генеративные модели разблокировали огромное количество новых продуктов и новых фич в уже существующих. Поиграться с ними успел, кажется, каждый. И сценарий почти всегда повторяется: команда быстро собирает прототип на внешнем API, выкатывает его в продакшен, продукт начинает приносить ценность, а вместе с ценностью приходит и тревога. Работает ли всё так, как мы ожидали? В этот момент хочется уже не угадывать, а измерять.Эта статья про то, как измерять. Точнее, про то, как тестировать и мониторить адаптивные LLM-системы в продакшене и до него, чтобы убедиться: ассистент ведёт себя так, как задумано.Что именно мы оцениваем

продолжить чтение