llm. - страница 30

llm.

Silicon Office: превратил свою команду ИИ-агентов в пиксельный офис из «Кремниевой долины»

Всем привет! Хочу поделиться выходным проектом, который вырос из чистой вкусовщины: мне надоело смотреть на бегущие строчки в терминале, и я сделал так, чтобы мои ИИ-агенты сидели в пиксельном офисе, пили кофе и приносили ответы лично. Подробнее — под катом.Как я до этого дошёл

продолжить чтение

Контекстная инженерия: что это такое, как работать с контекстом и почему за это начали платить

Вы собрали диалоговую систему — агента с RAG, инструментами и памятью. На коротких диалогах всё работает: модель выбирает нужный инструмент и достаёт данные. Но через несколько десятков итераций агент уже путает инструменты, тянет в ответ старые вызовы и опирается на ошибку, которая раньше попала в контекст.Новый промпт не всегда решает проблему: важно управлять тем, какая информация попадает к модели перед каждым следующим шагом. Это и называют контекстной инженерией. 

продолжить чтение

Как оценить библиотеку для ИИ-агентов без слепой проверки финального ответа

Сравниваем ревизии transformers по разным метрикамИИ-агенты для программирования

продолжить чтение

From Wizard to Warlock: магия в D&D как метафора эпохи LLM

Привет, я Саша Овчинников, старший специалист по тестированию в Контуре. 👋Последние несколько лет я активно пользуюсь LLM для достижения своих личных целей:как глава фехтовального клуба практически полностью автоматизировал процессы в нём;как опытный тренер — написал сложный проект, который превращает разбор боя в нормализованный анализ, удобный для постановки экспериментов;собрал Музу — личного ассистента поверх Obsidian;и многое другое.

продолжить чтение

Чек-лист тестирования поисковой системы: от engine sanity до RAG и графов знаний

Чек-лист для тестирования поисковых и RAG-систем — от базовой работоспособности поискового движка до качества генерации, агентных сценариев и поведения на неполных данных. Шесть уровней проверок, сводная таблица с инструментами для каждого уровня и глоссарий из 50+ терминов. Проверку стоит организовывать по порядку, нет смысла гонять RAG-метрики, если система не проходит Уровень 0, то проблема может быть в том, что поиск не находит документ из-за опечатки в запросе, а не в качестве генерации. Перед тестированием По каким полям/источникам поиск должен работать, по каким — нет

продолжить чтение

J-пространство Anthropic: рабочее пространство, сделанное из слов. Почему Выготский объясняет данные лучше Баарса

Сотрудники Anthropic опубликовали 6 июля 2026 года результаты своего нового исследования в котором заявили об обнаружении в Claude аналога "глобального рабочего пространства" — J-space.Исследование крайне интересно, и, как я считаю, раскрывает будущее нейросетей глубже, чем кажется на первый взгляд.В этой статье я рассмотрю, почему Теория глобального рабочего пространства описывает структуру находки, но молчит о её главной странности — о том, что workspace состоит из слов. И почему на этот вопрос сто лет назад ответил Лев Выготский.Суть исследования

продолжить чтение

Как мы внедряли ИИ на 500 инженеров, а скорость не росла. Часть 2. Почему AI-first команды не делают нас быстрее

В первой части статьи мы пришли к выводу, что само использование ИИ не ускоряет инженерную систему. Можно вырастить использование LLM-инструментов в принципе (MAU LLM), потом использование кодинг-агентов (MAU API) и всё равно не увидеть изменений в Lead Time, Throughput и Defect Rate.Проблема в том, что локальное ускорение быстро упирается в остальной процесс. Один человек или одна роль могут начать делать свою часть быстрее, но задача всё равно ждёт требований, проверки, тестирования, согласований, соседних команд или бизнес-эксперта. Поэтому дальше мы пошли в Agentic Engineering.

продолжить чтение

Жизнь после RAG: MCP, логи и автоматический анализ тикетов Jira

Привет, Хабр! Меня зовут Илья Парамошин, я ведущий инженер в МТС Web Services. В прошлый раз я рассказывал об архитектуре RAG-помощника для технической поддержки: индексации Confluence и Jira, гибридном поиске, генерации ответов с цитатами и оценке качества поиска. А недавно мы опубликовали продолжение — о том, как построили ИИ-агента для анализа тикетов.

продолжить чтение

Своя GPT-like LLM по WH40K с нуля. Часть 1: токенизируем Империум

Привет, Хабр! Меня зовут Владимир, и я давно хотел погрузиться во вселенную Warhammer40K. И в прошлом году я решил серьёзно подойти к этому вопросу - поискал в интернете с чего начать. Интернет подсказал, что единственный путь начать - почитать Ересь Хоруса. Дальнейший поиск показал

продолжить чтение

Neural Networks for Beginners. Part Zero. Overview

Every time you say “Thank you” to a neural network, you trigger a pipeline that multiplies hundreds of matrices with billions of elements, burning as much electricity as an LED lamp in a few seconds.This is the first article in a small series dedicated to networks for AI/ML clusters and HPC.In this series, we will touch upon the principles of how models work and are trained, parallelization, DMA and RDMA technologies, network topologies, InfiniBand and RoCE, and we’ll also philosophize on the topic of general and special solutions.Specifically in this article, we will figure out what a neural network is, how it works, how it is trained, and most importantly, why it needs hundreds of expensive GPU cards and some kind of special network.The refrain of today’s story is: there is no magic in neural networks—it’s just a multitude of simple operations on numbers performed on computers with special chips. There is no magic in how they work, nor in the infrastructure on which they run.Let’s dive in!Table of Contents

продолжить чтение