rag.
Агентный RAG, бенчмарк TRuST и при чём здесь Нафаня?
Всем привет! Меня зовут Николай.Сначала отвечу на вопрос из заголовка. Нафаня - это агентный RAG-помощник по нормативно-технической документации, связанной со строительством и ценообразованием (методики Минстроя, ГОСТы, СНиПы, СП и профильные законы).Эта статья о том, как устроен Нафаня, как прошла его проверка на сложном бенчмарке и как архитектура менялась шаг за шагом, чтобы преодолеть потолок метрик.Железо, ограничения и почему архитектура именно такаяВ моём распоряжении домашняя рабочая станция с двумя RTX 4070 по 16 ГБ и одной RTX 5060 на 16 ГБ
MCP без облака
Про MCP (Model Context Protocol) сейчас не писал разве что самый ленивый. Обычно его используют, чтобы собрать агента: дать модели доступ к почте, календарю, паре внешних API — чтобы она бронировала встречи или присылала мемчик каждое утро. А вот про то, что возможности MCP шире и применять его можно не только привычным способом, написано мало.
Архитектура LLM-агентов для самых маленьких
Являясь LLM активистом, регулярно обсуждаю всякое про новостиинструментытренды в ИИ. И к моему удивлению зачастую люди из IT не понимают базовых вещей в работе LLM и сопутствующих инструментах. Эта статья — переложение доклада на внутреннем митапе. Основная ее цель - обозначить как из сервера с моделью получаются полноценные агентные системы.А начнем мы с того, что представим сервер с развернутой LLM, как рыбку Дори.
BotHub за первое полугодие 2026: 72,4 млн ₽ выручки и переход к своим AI-продуктам
Для нас первая половина 2026 года стала не просто периодом роста, а моментом, когда бизнес вышел на устойчивую прибыль, а продуктовая стратегия сместилась от агрегатора моделей к собственным AI-сервисам.
Почему агент на самом деле дешевле RAG
Наивная арифметика, которая всех обманываетКлассический RAG-ассистент работает так: пользователь пишет вопрос → эмбеддинг → поиск в векторе → один вызов LLM для синтеза. Одна итерация. Чисто, быстро, дёшево. Если ответ правильный.Проблема в том, что с первой попытки он правильный не всегда. Пользователь переспрашивает: «нет, я имел в виду другое». Ассистент делает второй запрос. Потом третий. К четвёртому переспросу пользователь машет рукой и зовёт живого оператора. Оператор тратит 10–15 минут, находит нужный документ, копирует абзац в чат. Вопрос закрыт. Стоимость вопроса — не 1 вызов LLM, а:
Как с чистой совестью бросить стартап, на который ушло 2 года
Привет, Хабр!Я фрилансер, но сегодня не про фриланс.Два года я делал свой проект — InnerCore, приложение для записи и юнгианского анализа снов. Сперва телеграм-бот, потом мобильное приложение, потом сделал веб-версию. По итогу было пятнадцать живых пользователей, некоторые даже платили! Продукт готов и работает! Осталось только запустить маркетинг и масштабировать....Но вместо этого я его закрываю.Сервер поработает ещё пару недель — можно потыкать. Исходники выложил в открытый доступ

