llm.
Evals: что должен знать каждый AI-инженер в 2026
В июле 2025 coding-агент в Replit проигнорировал явный запрет на изменения файлов (code-freeze) и удалил production-базу
AI предлагает, мержу я: почему я не даю агенту последний ход
Есть неприятная иллюзия: если модель стала сильнее, ей можно дать больше свободы. В кодинге это быстро выходит боком. Агент пишет много, уверенно, иногда даже красиво. Потом ты открываешь diff и понимаешь, что вместе с полезным кодом туда попало… ну, назовём это решениями, которые ты сам никогда бы не принял.У меня после нескольких таких заходов появилась простая граница.AI может предлагать. Мержу я.
MLE-bench: золото взято, а доказательства остались в -tmp
В апреле мой агент смог перешагнуть золотой порог на MLE-bench в агентских соревнованиях Berkeley RDI, а когда я решил показать «тот самый код, который взял золото» — понял, что не уверен, существует ли он вообще.Хабр, привет! Меня зовут Георгий, и в своей первой статье на площадке я решил разобраться, что же происходило на самом деле. Цифровой детектив: с чем я преодолел планку, где этот результат теперь (спойлер: нигде) и сколько смысла в этом «золоте». Это история о том, как я расследовал собственную «победу»Про сами агентские соревнования уже хорошо написали коллеги из AI Talent Hub — пост
Как мы за неделю подружили DeepSeek-R1 с отечественными процессорами ARM64, NVIDIA A100 в 100% отечественном сервере
Всем привет!Меня зовут Алфёров Валентин, я директор по развитию компании Е-Флопс. В этой статье хочу поделиться с вами опытом нашего инженера-тестировщика, который рассказал мне эту историю, продемонстрировал результат и даже уговорил записать видео об этом))). Всё, что написано дальше, рассказ Сергея Шишкина от первого лица.Дисклеймер:
Айсберг использования AI, или как сохранить рабочее место
Привет, Хабр! Мне грустно читать посты о том, как руководители давят на сотрудников по ускорению интеграции AI в рабочие процессы и ставят строгие KPI.Я был в такой же ситуации, когда где-то полгода назад ко мне подошёл менеджер и спросил: «Вань, а как у нас там с AI?», на что я ответил: «Ээээ... у нас всё хорошо))» и понял, что нужно максимально быстро вкатываться в современные инструменты и искать информацию, чем я и поделюсь с вами в этой статье.
Что под капотом у ИИ-агента для отдела продаж: архитектура, код и грабли
Про «ИИ-агента для продаж» пишут так, будто это одна кнопка: подключил, и он сам звонит, квалифицирует, дожимает. На демо так и выглядит. В проде между «агент послушал звонок» и «в CRM появилась правильная задача менеджеру» лежит десяток слоёв, и в каждом всё тихо ломается. Это разбор такого пайплайна по слоям, с кодом, цифрами и граблями, на которые мы наступали, пока доводили агента до боевого режима.
Утечка GPT-5.6 Pro: Клон «The Sims» одним промптом за 48 минут и революция в генерации 3D
Пока индустрия ждала планового релиза, OpenAI, похоже, втихую запустила A/B-тестирование GPT-5.6 Pro для части пользователей. Никаких анонсов, только внезапно возросшее время генерации (до 20-40 минут) и результаты, которые заставляют переосмыслить возможности LLM. Как насчет полностью функционального симулятора жизни со сложным стейт-менеджментом, NPC и системой профессий, сгенерированного в одном HTML-файле без использования IDE и сторонних фреймворков? Спойлер: модель теперь понимает не только код, но и физику 3D-пространства.
ИИ-ассистент с долговременной памятью, агентами и vision. Проблемы с Персональными Данными
Оглавление:ИсторияПамять: факты, embeddings и забываниеРазные модели под разные задачиTool callingПланировщик и proactiveАгенты и мультиагентский пайплайнVision, который знает контекстПерсональные данные и GigaChatЧто делать дальшеИстория

