Анализ и проектирование систем. - страница 19

Почему ломается ваш AI-агент — и почему смена модели обычно его не чинит

Представьте внутреннего AI-агента, который помогает компании искать общие документы и управлять ими. Он работает. До тех пор, пока 12–15% запросов не начинают падать. Агент возвращает не тот документ, редактирует не тот файл, молча падает или уверенно ссылается на файл, которого не существует. Поиск по фото отказывает с той же частотой. Ошибки размазаны равномерно по пользователям, фичам и запросам.

продолжить чтение

Spec-driven development в микросервисах, часть 2: как archspec делает контекст сервисов явным

Вторая статья из цикла из трёх частей.Часть 1 — где LLM теряет межсервисный контекст и почему локальных спек недостаточно.

продолжить чтение

AI обнулил benchmark и пытался шантажировать инженера. И почему это решаемо

В прошлой главе я разобрал три провала чужих AI-агентов в проде - PocketOS, потерю production-базы Replit и сценарии GitHub Copilot, в которых агент действовал быстрее, чем человек успевал сказать стоп.Финал был честный: эти три - не про то, как делать правильно. Это места, где меня поймало бы, если бы я не прочитал разборы до того, как Lexis стал продуктом для людей.И я обещал в следующей главе перейти с уровня отдельные истории на уровень данных. Конкретно - две вещи.Первая: ProgramBench. Топ-модели, которые закрыли SWE-bench на 95%, на ProgramBench показывают 0% и 3%. Не упали на десять пунктов - обнулились.

продолжить чтение

Я построила диагностику «стоит ли это автоматизировать» — и она трижды говорила глупости. Разбор ошибок

Инфографика-диалог из четырёх реплик между заказчиком и аналитиком, мемная

продолжить чтение

RAG в энтерпрайзе: почему демо работает, а прод нет

Представьте себе типичное совещание. Кто-то из руководства возвращается с конференции, садится напротив и говорит: «У них там бот по внутренней документации, надо себе такой же. До конца квартала».Через четыре месяца у тебя есть Pinecone, OpenAI API, две недели работы над парсингом PDF и чат-бот, который на демо отвечает на пять подобранных вопросов идеально. А на шестой, который задаст любой нормальный сотрудник, отвечает уверенным бредом.Дальше про то, что именно между этими двумя состояниями происходит. Но без «правильной архитектуры RAG», потому что такой не существует.

продолжить чтение

Масштабирование LLM: от одного чипа до ЦОДа. Глава 2. Шардинг

Это продолжение цикла статей о масштабировании тренировки и инференса LLM. Предыдущая глава находится по этой ссылке.Итак, с основами разобрались, давайте теперь разбираться с тем, как распихать матрицы по нескольким чипам, перемножить, а затем собрать это все в удобоваримый результат. По-умному это называется шардинг.

продолжить чтение

Как проектировать ИИ‑инструменты, которые делают пользователей лучше

продолжить чтение

671 Allow в Claude Code за день: как родился сетап Spec-build

Вступление Это история о том, как попытка починить маленький раздражитель в Claude Code неожиданно привела меня к полноценному сетапу для разработки фич совместно с AI-ассистентом. Приложил немного музыки для атмосферы. Я больше 10 лет работаю в продуктовом дизайне и дизайн‑менеджменте. Обычно — на стыке дизайна, процессов и продукта. Помогаю компаниям решать проблемы деградации интерфейсов, несистемности и слабой синхронизации между дизайном и разработкой.

продолжить чтение

Иллюзия трансформации: почему компании платят за спектакль вместо изменений

Об особенностях корпоративных преобразований, их настоящей цене и основном вопросе, который стоит задать до старта1. Спектакль, который все видят, но никто не называет

продолжить чтение

Границы 100% разработки с агентами

продолжить чтение

1...10...171819202122...3040...58