Почему инференс LLM становится дорогим и как снизить расходы на GPU без покупки новых карт
Материал подготовлен в рамках курса «MLOps».Всем привет, меня зовут Сергей Прощаев и в этой статье расскажу про то, как снизить стоимость инференса LLM на собственных GPU, не меняя
Оценка AI‑агентов: 7 ошибок, из‑за которых тесты врут
Всем привет, меня зовут Сергей Прощаев, и в этой статье расскажу про семь ошибок в оценке AI‑агентов — тех самых, из‑за которых прогон тестов светится зелёным, а о деградации команда узнаёт от поддержки.У команды есть
GitHub Copilot получил локальную изолированную среду для выполнения действий
GitHub добавил в приложение GitHub Copilot поддержку локальных изолированных сред (local sandboxes). Теперь агент Copilot может выполнять команды и работать с файлами внутри отдельного окружения на компьютере разработчика, не получая прямой доступ ко всей системе. Новая возможность предназначена для сценариев, где Copilot выполняет более сложные задачи: запускает инструменты, изменяет код, проверяет результаты работы и взаимодействует с проектом. Изоляция позволяет ограничить область его действий и снизить риски при использовании агентных возможностей.
AI пишет код быстрее, но ревью становится тяжелее: откуда берётся когнитивный долг
TL;DRВремя на погружение в контекст теперь приходится в основном на этап ревью.Если принимать код только потому, что он работает, можно накопить долг, которого команда даже не замечает.Стоит либо снижать объём ручного ревью, либо автоматизировать повторяющиеся проверки.В разговоре с одним из клиентов об AI-разработке я услышал мнение, что ревью кода, сгенерированного агентами, создаёт огромную когнитивную нагрузку — приходится одновременно держать в голове множество деталей, чтобы понять работу и оценить её качество.
GitHub обновил Copilot для JetBrains: появились автоматические подтверждения действий и управление MCP‑инструментами
GitHub выпустил версию 1.18.0 плагина GitHub Copilot для IDE от JetBrains. В обновлении появились новые возможности для работы с агентами: автоматическое подтверждение безопасных действий, редактирование предыдущих сообщений в диалогах, поддержка общих инструкций организации и расширенное управление MCP‑инструментами. Рассмотрим изменения подробнее.Автоматическое подтверждение безопасных действий
Нода загружена на 40%, а поды стоят: как найти причину через PSI в Kubernetes
Привет, Хабр!Управление ресурсами в Kubernetes десять лет держалось на двух числах в манифесте. Request определял, куда планировщик поставит под и сколько ему достанется при драке за процессор. Limit ограничивал сверху. Оба числа выставлялись один раз, менялись только пересозданием пода, а проверить их правильность было нечем, кроме графиков утилизации.
Как проверить postmortem, подготовленный LLM. Разбираем инцидент Cloudflare
«Все сервисы восстановили в 14:30» выглядит как обычная строка хронологии. Но для инцидента Cloudflare, который мы разберём ниже, она неверна: к этому времени в значительной степени восстановился основной трафик, а полное восстановление наступило позже.Такое сокращение меняет оценку последствий сбоя. Команда рискует пропустить часть проблем и меры, которые помогли бы их устранить.Если вы поручаете большой языковой модели, LLM, подготовить postmortem, письменный разбор причин и последствий сбоя, результату нужна содержательная проверка. Разберём её на материале
Запустить LLM локально: что считать до покупки видеокарты?
Всем привет, меня зовут Сергей Прощаев, я Tech Lead и руководитель направления Java/Kotlin‑разработки в FinTech & E‑commerce, преподаю на курсах разработки и архитектуры в ОТУС.В этой статье расскажу про домашний стенд для локального инференса

