Harness Bench: как оценить агентский harness и выбрать связку с моделью
Привет! Я Андрей Иванов, NLP-исследователь в R&D-лаборатории red_mad_robot.
Почему я перестал слать каждый вопрос в LLM: архитектура предсказуемого конвейера
О проекте. Я разрабатываю систему ИИ-поддержки первой линии — «Финлоджик. Контур Поддержки» (FinlogiQ AI Support). Бот принимает обращения через веб-чат и Telegram, понимает суть вопроса, ищет ответ в базе знаний и передаёт сложные случаи живому оператору. Делаю один: начиналось как заказная разработка под клиента, затем выросло в самостоятельный продукт. Это первая статья из цикла о внутреннем устройстве системы.Пара терминов: LLM (large language model) — большая языковая модель, нейросеть вроде YandexGPT или DeepSeek; RAG
Как мы строим корпоративную экзаменационную платформу с AI: архитектура, дубли, мульти-tenant и продовые шишки
Привет, Хабр.Хочу рассказать про наш проект Exam AI
От PDF к учебному модулю: практичный ML-пайплайн внутри LMS
Всем привет, с вами Михаил Киселев, ML-разработчик в компании WebRise. И сегодня поговорим о практическом применении ML в образовании.
Как подключить таск-трекер к кодовой базе через RAG и не сойти с ума от стоимости токенов
Открытый плагин для Claude Code / OpenCode с solve-task — от задачи до реализации без ручного сбора контекста.Работаю с AI-ассистентами в реальной разработке уже достаточно давно, чтобы понимать: главная проблема не в качестве модели. Главная проблема — контекст.LLM хорошо рассуждает о коде, когда у неё перед глазами правильный код. Но «правильный код» в реальном проекте — это не один файл. Это конкретный символ, его вызывающие, его тесты, смежные PR, существующий паттерн в репозитории, который не стоит ломать.
Сдерживаем полет фантазии LLM в киносервисе
Привет, меня зовут Никита, я — ИИ‑энтузиаст и люблю кино. Я делаю сервис для ведения базы кино с друзьями, планирования просмотров и трекинга сериалов, мы используем искусственный интеллект в нашем сервисе, и про него я как раз хочу рассказать: полгода назад я начал открывать для себя его возможности, и с тех пор исследую всё новое и новые способы применения, экспериментирую с мультиагентными системами и ищу, как интересно можно применить нейросети. Так как я изучаю всё методом проб и ошибок, путь тернист, и если вы захотите поделиться вашим взглядом или идеями, буду рад их услышать!
ContentCombine: как я сделал мультинишевый контент-комбайн и запустил ежедневный SEO-дайджест
Визуализация комбайна
Граф кода одной командой: ставим graphlens-mcp в проект и перестаём жечь токены на grep
Третья часть серии. В первой я разбирал сам движок graphlens — что он делает и как устроен внутри. Во второй гонял бенчмарк на 936 прогонов и смотрел, где граф реально окупается, а где проще остаться с grep. Здесь — про то, что осталось за кадром в обеих частях: движок это ещё не инструмент, и чтобы подключить его к агенту, поверх нужно дописать прилично кода. Вот этот код я и собрал в отдельный продукт. graphlens-mcp ставится одной командой, дальше работает сам. Он в alpha, бесплатный (MIT), и прогнать его на своём проекте можно минут за пять.
Я устал писать одноразовые скрипты для бенчмарков LLM и собрал харнесс, который сам считает Pareto-front
LLM inference benchmarkС чего все началосьУ меня была вполне приземленная задача: понять, на каком бэкенде гонять одну и ту же открытую модель — на vLLM, llama.cpp, ONNX Runtime или просто на transformers. Звучит как вопрос на пять минут, пока ты не начинаешь честно мерить.

