От Naive RAG до ReAct-агента: как мы строили корпоративного AI-помощника на open-source моделях (часть 2)
Привет, Хабр! Меня зовут Саша, я — старший AI-инженер в Лаборатории искусственного интеллекта «Честного знака». Наша команда развивает «Честного помощника» — мультиагентную LLM-систему для обработки документов, поиска информации по Confluence, Jira, GitLab и генерации текстов. Главная цель команды — повышать эффективность и качество работы сотрудников за счёт расширения числа специализированных агентов в нашей мультиагентной системе.
Трансформеры и бизнес: где ИИ даёт эффект, а где сжигает бюджет
Короче, такая история. В моей практике бывало такое, что приходит команда и говорит: «хотим внедрить ИИ». А под этим она понимает что-то среднее между волшебной кнопкой и наймом робота на ставку аналитика. Через пару часов разговора выясняется, что ожидания и механика расходятся примерно на световой год. Происходит это часто — и именно поэтому стоит один раз разобраться, что там внутри и откуда берётся настоящий эффект.Что такое языковая модель и как она думает
Тест Лавлейс: переосмысление
Почему один из самых требовательных тестов ИИ уже, похоже, пройденТест Лавлейс предложили в 2001 году, чтобы закрыть слабые места более известного теста Тьюринга
Как дообучить LLM. Рассказываю шаг за шагом
Всем привет, меня зовут Максимов Максим. Я Team Lead в R&D-лаборатории компании red_mad_robot и автор Telegram‑канала Максим Максимов // IT, AI. Сегодня мы погрузимся в тему дообучения больших языковых моделей (LLM). Вначале я дам небольшую вводную, а далее на практике разберём, как дообучить LLM извлекать информацию из текста в формате JSON по заданной схеме. ВведениеОписание экспериментаХод экспериментаПоехали!Введение
Как промт превратил языковую модель в проводника смыслов и источник инсайтов для бизнеса: AI-конструктор офферов
История эволюции бизнес-инструмента: от разработки сайтов и создания офферов до AI-агента-проводника, который помогает предпринимателю прояснить свой бизнес через диалог.AI - проводникВступлениеСтатья состоит из двух частей.
«Смотря какой fabric, смотря сколько details». Как и почему LLM оказались не в состоянии перевести текст
В прошлой статье я рассказывал, как за несколько месяцев в одиночку запилил сервис генерации статей, и как он в итоге оказался комплексной платформой по работе с контентом.За эти месяцы в процессе разработки постоянно всплывали проблемы. Что-то было связано косяками с моей стороны, а что-то — с особенностями работы LLM. Об одной из таких проблем, достаточно абсурдной и при этом с трудом поддающейся решению, я расскажу отдельно.Суть проблемыЕще на ранних этапах разработки я запустил конвейер по написанию (точнее, рерайтингу) новостей.
Как устроены LLM‑агенты: архитектура, планирование и инструменты
Если вы хоть раз просили ChatGPT что‑то сделать и получали в ответ длинный текст без какого‑либо реального действия — вы работали с обычной языковой моделью. Она умеет генерировать текст, но сама ничего не делает: не лезет в интернет, не запускает код, не сохраняет файлы. Просто отвечает.LLM‑агент — это другая история. Это система, которая получает задачу и начинает её решать: ищет информацию, пишет и запускает код, вызывает API, сохраняет результаты. Она не просто говорит «вот как это можно сделать» — она берёт и делает.
Сократ + GPT: как построить диалог с LLM, который учит
Иногда мне приходится проверять домашнее задание у детей. Как правило, я не смотрю в тетрадь, а начинаю диалог с фразы "А почему ты так сделал?".Детям не всегда нравится такой подход, но он определенно дает результат. Чтобы перевести негатив с себя на бездушную машину, я решил сделать приложение для проверки усвоения материала.Возник вопрос: как же построить диалог с нейросетью, чтобы он был полезным? Здесь мне на помощь пришел университетский курс философии - можно попробовать построить сократический диалог.Основные этапы и принципы работы такого диалогаИнициация (Постановка проблемы).
Как и зачем мы сделали собственный OCR-бенчмарк
Однажды нам понадобилось выбрать OCR-модель для RAG-пайплайна. Казалось бы, задача простая: смотришь на лидерборды, берешь лучшую, PROFIT. Но быстро выяснилось, что, во-первых, то, что прекрасно срабатывает на каких-нибудь английских юридических документах, может не потянуть такие штуки как научные формулы, паспортные данные и таблицы на русском языке. А во-вторых, даже если крутой по всем параметрам бенчмарк для оценки качества распознавания говорит, «всё прочитали правильно, я проверил», точность ответов пользователю, который совершает запрос к чат-боту с RAG под капотом, может страдать.
Evals для чайников. Как тестировать AI-агента, чтобы понимать, где именно он ломается
Большинство команд оценивают производительность AI-агентов через end-to-end метрики: success rate, количество токенов, tool usage, стоимость запроса, долю успешных задач. Это полезно для общего контроля ситуации, но почти бесполезно для реальной диагностики системы.

