llm. - страница 88

llm.

ContentCombine: как я сделал мультинишевый контент-комбайн и запустил ежедневный SEO-дайджест

Визуализация комбайна

продолжить чтение

Как агент сам откроет дверь хакеру? Разбираю три реальных пробоя AI-агентов и почему обычный ред-тиминг их не найдёт

Как агент сам откроет дверь хакеру ? Разбираю три реальных пробоя AI-агентов и почему обычный ред-тиминг их не найдёт.TL;DR: Я добавил в свой опенсорсный сканер BarkingDog режим атаки на AI-агентов с инструментами. Прогнал его на трёх популярных opensource- АГЕНТАХ: Agno, OpenAI CS Agents Demo, LangGraph agent-service-toolkit

продолжить чтение

Архитектура ИИ-агента с желаниями или цифровой человек

У меня обычно так: я довожу проект до прототипа, доказываю себе, что моя идея работает — и теряю интерес. Проект lifemodel — один из таких. Это ИИ-агент, которого я строил не как чат-бота, отвечающего на вопрос, а как «цифрового человека»: с сердцебиением, энергией и желаниями, которые возникают сами и сами побуждают его действовать. Прототип заработал. А потом, как обычно, мотивация кончилась.

продолжить чтение

Как желание быстрее читать чужой код превратилось в войну с недетерминизмом LLM

Откуда это всё вырослоНачалось всё примерно так. Я сидел над своим проектом: пока работал, общался по нему с нейросетками и параллельно искал в интернете разную информацию, которая могла бы пригодиться. И вот тогда у меня впервые начала закладываться мысль, что я хотел бы читать код быстрее. Что мне не нравится, сколько времени на это уходит.

продолжить чтение

Граф кода одной командой: ставим graphlens-mcp в проект и перестаём жечь токены на grep

Третья часть серии. В первой я разбирал сам движок graphlens — что он делает и как устроен внутри. Во второй гонял бенчмарк на 936 прогонов и смотрел, где граф реально окупается, а где проще остаться с grep. Здесь — про то, что осталось за кадром в обеих частях: движок это ещё не инструмент, и чтобы подключить его к агенту, поверх нужно дописать прилично кода. Вот этот код я и собрал в отдельный продукт. graphlens-mcp ставится одной командой, дальше работает сам. Он в alpha, бесплатный (MIT), и прогнать его на своём проекте можно минут за пять.

продолжить чтение

Я устал писать одноразовые скрипты для бенчмарков LLM и собрал харнесс, который сам считает Pareto-front

LLM inference benchmarkС чего все началосьУ меня была вполне приземленная задача: понять, на каком бэкенде гонять одну и ту же открытую модель — на vLLM, llama.cpp, ONNX Runtime или просто на transformers. Звучит как вопрос на пять минут, пока ты не начинаешь честно мерить.

продолжить чтение

Как объяснить вайбкодеру, что “работает” — не значит “сделано нормально”

Привет, Хабр!Я фрилансер! ТГ-боты, бэкенды, AI-интеграции, с недавних пор embedded. В прошлой статье я показывал, как биржу залило вайб-кодерами и как просели цены на базовые проекты. Но там я говорил про цену. А есть вопрос следующий: а код-то у них рабочий? В смысле — рабочий по-настоящему, а не «вроде запускается».Сразу дисклеймер: я каждый день работаю через Claude Code, я на них построил весь свой процесс. Именно поэтому мне интересно где у них системный предел.И я внутри этого рынка, объективности не обещаю.

продолжить чтение

Как измеряют LLM: параметры, бенчмарки и тесты на коленке

В комментариях к моей предыдущей статье о тестировании трех флагманских LLM моделей были примерно такие мысли и вопросы:Я взял простую бесплатную LLM, запустил локально и она тоже справилась.А почему вы в свое сравнение не взяли никого от DeepSeek, они же тоже хороши?А зачем всем один и тот же промпт, они же по-разному их воспринимают?

продолжить чтение

Как создать AI‑агента на Java: связка Spring AI + MCP

Всем привет, меня зовут Сергей Прощаев, и в этой статье расскажу про то, как Java и Spring за последний год заметно подтянулись в теме, где долго и заслуженно лидировал Python, — продакшен AI‑агентов. Сразу обозначу позицию, чтобы не было разночтений. Я Tech Lead и руководитель направления Java | Kotlin разработки в FinTech & E‑commerce и преподаю на курсах разработки и архитектуры.

продолжить чтение

Разработчики больше не нужны? Новое исследование Anthropic на 400 000 сессий — и мой спор с ним

Anthropic выложила исследование на ~400 000 сессий Claude Code: успех с AI-агентами определяет не умение писать код, а понимание своего дела. Профессия почти не важна — у не-программистов 26% подтверждённого успеха против 30% у разработчиков.Эксперт в предметной области запускает в 2.4× больше действий агента на одну команду (12 против 5) и вчетверо чаще вытаскивает зашедшую в тупик сессию (15% против 4% у новичка).Половину этого я писал раньше: планируй, говори агенту «что», а не «как», и разбирайся в том, что делаешь. Приятно, когда данные сходятся с интуицией.

продолжить чтение