искусственный интеллект. - страница 37

ИИ не напишет за вас: как масштабировать проект и не утонуть в нечитаемом коде

Контекст

продолжить чтение

Почему ваша LLM тупеет на больших документах и как ее починить

Привет, Хабр!Меня зовут Андрей Бирюков. Я — независимый эксперт в области ИТ и ИБ, преподаю в учебных центрах и пишу статьи и книги. Когда Google анонсировал 2M контекста, а Anthropic подкинул еще 100K, наверняка многие подумали, что RAG теперь можно выкинуть на свалку истории. Зачем париться с этими чанками, эмбеддингами и всякой прочей ерундой, если можно просто кинуть в модель весь дамп википедии и спросить ее что угодно?

продолжить чтение

Проверяем Jev на открытых и внутренних данных: классификаторили фильтр?

Jev отвечает только «да/нет» или выбирает один из предложенных вариантов. 16 000 вызовов:сначала сравнение с gpt-5.4-mini и gpt-5.6-luna на четырёх открытых датасетах, затем несколько тысяч реальных решений в рабочих процессах. Где он выигрывает, где ошибается и как его использовать.

продолжить чтение

Захватывающая история внедрения ИИ в умирающей не-IT-компании

Вся история выдумана. Любые совпадения с именами, должностями и компаниями случайны.Как компания забрала рынок

продолжить чтение

ИИ пишет тесты, но кто проверит ИИ: как меняется QA в 1С-командах

ИИ уже умеет генерировать тесты, разбирать легаси-код и помогать с автоматизацией QA. Но без правил и контроля он так же уверенно создает бесполезные проверки. Поэтому главный вопрос сегодня — не «можно ли применять ИИ в тестировании», а «как встроить его в процесс, чтобы качество действительно росло».Модераторы

продолжить чтение

История продолжений: что после действия участвует в следующем ходе

Человеку почти никогда не приходится начинать с нуля. К моменту его включения в ситуацию многое уже участвует в том, как она может продолжиться: язык сохраняет прежние различения, профессия — найденные способы решения, организация — правила и распределение работы, интерфейс — подготовленные действия. Благодаря этому следующий участник получает результаты работы, которую ему не приходится повторять.

продолжить чтение

Программирование для тех, кто не пишет код: как устроен VibeCraft

продолжить чтение

Тупая модель с жёстким циклом проверки бьёт умную модель без него

Недавно читал тут статью про «Cost per Task» и про то, что самая дешёвая модель в линейке внезапно обгоняет самую умную по цене решённой задачи. С выводом согласен полностью, но хочу добавить то, чего в той статье не было: дело не только в модели. Дело в том, что происходит после того, как модель написала код.Последние восемь месяцев я строю агентную обвязку, в которой модель не просто пишет файлы, а обязана доказать, что написанное работает. Выяснилось следующее: если прикрутить к слабой модели честный цикл верификации, она уверенно обходит сильную модель, работающую в режиме «написал и отчитался».

продолжить чтение

Headroom на 80 запусках агента: что получилось с расходом токенов

Недавно увидел ещё один репозиторий с обещанием резко сократить расход контекста у LLM-агентов — Headroom. Я сейчас исследую эту тему на примере SKILL.state и уже писал о первых результатах на Хабре - это были первые инженерные эксперименты; более строгие проверки ещё продолжаются. Так что меня заинтересовал подход headroom и я решил заодно с прочими экспериментами наскоро прогнать Headroom через тот же тестовый стенд. Эта статья — о том, что получилось.

продолжить чтение

Почему regex больше не находит клиентов в Telegram: препарируем 12 081 сообщение с помощью каскадного AI-скоринга

## TL;DR (BLUF)Классический мониторинг Telegram-чатов по ключевым словам («ищу разработчика», «нужен сайт», «требуется подрядчик») в 2026 году технически мертв: регулярные выражения пропускают 79.5% целевых коммерческих заявок и одновременно генерируют более 60% ложноположительного шума (самореклама исполнителей, вакансии, взаимопиар). В этой статье мы разбираем инженерную архитектуру трехуровневого каскадного пайплайна: от легковесных эвристик (2 мс) и мультиязычных эмбеддингов (15 мс) до LLM Decision Logic со строгой JSON-схемой. Все выводы подкреплены открытым бенчмарком на выборке из

продолжить чтение