python. - страница 9

Harness Bench: как оценить агентский harness и выбрать связку с моделью

Привет! Я Андрей Иванов, NLP-исследователь в R&D-лаборатории red_mad_robot.

продолжить чтение

Почему я перестал слать каждый вопрос в LLM: архитектура предсказуемого конвейера

О проекте. Я разрабатываю систему ИИ-поддержки первой линии — «Финлоджик. Контур Поддержки» (FinlogiQ AI Support). Бот принимает обращения через веб-чат и Telegram, понимает суть вопроса, ищет ответ в базе знаний и передаёт сложные случаи живому оператору. Делаю один: начиналось как заказная разработка под клиента, затем выросло в самостоятельный продукт. Это первая статья из цикла о внутреннем устройстве системы.Пара терминов: LLM (large language model) — большая языковая модель, нейросеть вроде YandexGPT или DeepSeek; RAG

продолжить чтение

Как мы строим корпоративную экзаменационную платформу с AI: архитектура, дубли, мульти-tenant и продовые шишки

Привет, Хабр.Хочу рассказать про наш проект Exam AI

продолжить чтение

От PDF к учебному модулю: практичный ML-пайплайн внутри LMS

Всем привет, с вами Михаил Киселев, ML-разработчик в компании WebRise.  И сегодня поговорим о практическом применении ML в образовании.

продолжить чтение

Как подключить таск-трекер к кодовой базе через RAG и не сойти с ума от стоимости токенов

Открытый плагин для Claude Code / OpenCode с solve-task — от задачи до реализации без ручного сбора контекста.Работаю с AI-ассистентами в реальной разработке уже достаточно давно, чтобы понимать: главная проблема не в качестве модели. Главная проблема — контекст.LLM хорошо рассуждает о коде, когда у неё перед глазами правильный код. Но «правильный код» в реальном проекте — это не один файл. Это конкретный символ, его вызывающие, его тесты, смежные PR, существующий паттерн в репозитории, который не стоит ломать.

продолжить чтение

Сдерживаем полет фантазии LLM в киносервисе

Привет, меня зовут Никита, я — ИИ‑энтузиаст и люблю кино. Я делаю сервис для ведения базы кино с друзьями, планирования просмотров и трекинга сериалов, мы используем искусственный интеллект в нашем сервисе, и про него я как раз хочу рассказать: полгода назад я начал открывать для себя его возможности, и с тех пор исследую всё новое и новые способы применения, экспериментирую с мультиагентными системами и ищу, как интересно можно применить нейросети. Так как я изучаю всё методом проб и ошибок, путь тернист, и если вы захотите поделиться вашим взглядом или идеями, буду рад их услышать!

продолжить чтение

ContentCombine: как я сделал мультинишевый контент-комбайн и запустил ежедневный SEO-дайджест

Визуализация комбайна

продолжить чтение

Как агент сам откроет дверь хакеру? Разбираю три реальных пробоя AI-агентов и почему обычный ред-тиминг их не найдёт

Как агент сам откроет дверь хакеру ? Разбираю три реальных пробоя AI-агентов и почему обычный ред-тиминг их не найдёт.TL;DR: Я добавил в свой опенсорсный сканер BarkingDog режим атаки на AI-агентов с инструментами. Прогнал его на трёх популярных opensource- АГЕНТАХ: Agno, OpenAI CS Agents Demo, LangGraph agent-service-toolkit

продолжить чтение

Граф кода одной командой: ставим graphlens-mcp в проект и перестаём жечь токены на grep

Третья часть серии. В первой я разбирал сам движок graphlens — что он делает и как устроен внутри. Во второй гонял бенчмарк на 936 прогонов и смотрел, где граф реально окупается, а где проще остаться с grep. Здесь — про то, что осталось за кадром в обеих частях: движок это ещё не инструмент, и чтобы подключить его к агенту, поверх нужно дописать прилично кода. Вот этот код я и собрал в отдельный продукт. graphlens-mcp ставится одной командой, дальше работает сам. Он в alpha, бесплатный (MIT), и прогнать его на своём проекте можно минут за пять.

продолжить чтение

Я устал писать одноразовые скрипты для бенчмарков LLM и собрал харнесс, который сам считает Pareto-front

LLM inference benchmarkС чего все началосьУ меня была вполне приземленная задача: понять, на каком бэкенде гонять одну и ту же открытую модель — на vLLM, llama.cpp, ONNX Runtime или просто на transformers. Звучит как вопрос на пять минут, пока ты не начинаешь честно мерить.

продолжить чтение