llm.
От одного агента к AI-холдингу: масштабирование автономных AI-систем
ИИ ускоряет выполнение отдельных задач, но управление растущим числом процессов и проектов остаётся на человеке. На примере своих экспериментов покажу путь от одного агента к AI-организации и объясню, зачем над несколькими направлениями может понадобиться AI-холдинг.Я пришёл к другому способу описывать такие системы постепенно, через четыре собственных эксперимента. Каждый следующий шаг отвечал на конкретное ограничение предыдущего:агент для оценки задач (покер планирования) учитывал не весь нужный контекст, поэтому я разделил работу на этапы;
Опубликована книга «Цифровой мозг фирмы»
Короткая книга о директоре в момент, когда машинный интеллект становится массовым рабочим инструментом.
У ИИ есть знания, у человека — контекст
TL;DR. Текст всё чаще доходит до читателя через два преобразователя: ИИ, с которым пишет автор, и ИИ, который делает выжимку для читателя. В КИПиА такая конструкция называется измерительным каналом, и у неё есть известное свойство: погрешности звеньев складываются, а проверять нужно канал целиком. Знание ИИ передаёт через канал хорошо. Контекст — нет. Ниже разбираю, какой именно контекст теряется, почему ошибка модели, общая для всех её читателей, опаснее обычного непонимания и как поверять такой канал автору и читателю.Два преобразователя между автором и читателем
Переговоры — это не только про работу: как я учу ИИ не поддаваться
Завтра разговор, которого вы боитесь: попросить прибавку, отказать клиенту в скидке, сообщить команде, что дедлайн сорвётся. Слова вы знаете наизусть — и всё равно прокручиваете их ночью. В какой-то момент открываете чат с нейросетью и пишете: «Сыграй моего начальника. Я прошу повышение, ты — против».
Какую LLM выбрать: собираем свой бенчмарк
Результаты внутреннего тестированияОбычно, когда выбирают LLM, сначала смотрят рейтинги. Проблема рейтингов в том, что по ним не узнать, как модель справится с вашими задачами и сколько это будет стоить.
Дешево, но не точно: разбираем контроллер доверия к памяти LLM-агентов
В 2024 году мэрия Нью-Йорка запустила чат-бота MyCity — цифрового помощника для владельцев малого бизнеса. Он должен был стать удобным справочником по городским правилам и законам. Но на деле бот раздавал советы, за которые предпринимателям грозили штрафы и суды, например, не выплачивать до конца чаевые сотрудникам, уволить человека за жалобу на харассмент, и прочее в таком духе.Правильная информация при этом лежала в собственной базе знаний бота наравне с устаревшей. Как оказалось, он просто-напросто не смог выбрать между верным и неверным, когда оба варианта оказались под рукой.
Программа поиска по PDF. Разбираем PageIndex, Streamlit и ссылки на страницы
«Срок гарантии — 18 месяцев». Красивый ответ. А если в договоре написано 12? Или число 18 стоит в разделе о хранении, а модель просто зацепилась за него?В чате такие ошибки прячутся за гладкой фразой. Я хотел иной маршрут: задать вопрос к PDF, получить ответ и одним нажатием открыть физическую страницу исходного файла, на которую ссылается модель. Так появился PDF Desk
Исследователи изучили языковые привычки Opus 5.5 и других моделей
Новое исследование маркетинговой фирмы Graphite изучило привычки письма передовых моделей, выявив любимые слова и фразы каждой из них. Компания обнаружила 13 000 фраз, которые встречались в контенте ИИ как минимум в два раза чаще, чем в созданном людьми.
Gemini 4 победила в бенчмарках. Почему это всё меньше говорит о качестве модели
Gemini 4 Argon вышел с таблицей, где он лидирует в 12 тестах из 18. Ровно такую таблицу Google показывала в феврале — для Gemini 3.1 Pro. Тот потом проиграл Claude в реальной работе больше чем на 300 очков. У релизов Gemini сложился сценарий, и Argon пока идёт по нему шаг в шаг. Дело при этом не только в Google: победа в бенчмарках сегодня значит всё меньше.Сценарий в трёх актахУ каждого релиза Gemini последний год один сюжет.

