Блог компании OTUS.

Почему инференс LLM становится дорогим и как снизить расходы на GPU без покупки новых карт

Материал подготовлен в рамках курса «MLOps».Всем привет, меня зовут Сергей Прощаев и в этой статье расскажу про то, как снизить стоимость инференса LLM на собственных GPU, не меняя

продолжить чтение

Оценка AI‑агентов: 7 ошибок, из‑за которых тесты врут

Всем привет, меня зовут Сергей Прощаев, и в этой статье расскажу про семь ошибок в оценке AI‑агентов — тех самых, из‑за которых прогон тестов светится зелёным, а о деградации команда узнаёт от поддержки.У команды есть

продолжить чтение

GitHub Copilot получил локальную изолированную среду для выполнения действий

GitHub добавил в приложение GitHub Copilot поддержку локальных изолированных сред (local sandboxes). Теперь агент Copilot может выполнять команды и работать с файлами внутри отдельного окружения на компьютере разработчика, не получая прямой доступ ко всей системе. Новая возможность предназначена для сценариев, где Copilot выполняет более сложные задачи: запускает инструменты, изменяет код, проверяет результаты работы и взаимодействует с проектом. Изоляция позволяет ограничить область его действий и снизить риски при использовании агентных возможностей.

продолжить чтение

AI пишет код быстрее, но ревью становится тяжелее: откуда берётся когнитивный долг

TL;DRВремя на погружение в контекст теперь приходится в основном на этап ревью.Если принимать код только потому, что он работает, можно накопить долг, которого команда даже не замечает.Стоит либо снижать объём ручного ревью, либо автоматизировать повторяющиеся проверки.В разговоре с одним из клиентов об AI-разработке я услышал мнение, что ревью кода, сгенерированного агентами, создаёт огромную когнитивную нагрузку — приходится одновременно держать в голове множество деталей, чтобы понять работу и оценить её качество.

продолжить чтение

GitHub обновил Copilot для JetBrains: появились автоматические подтверждения действий и управление MCP‑инструментами

GitHub выпустил версию 1.18.0 плагина GitHub Copilot для IDE от JetBrains. В обновлении появились новые возможности для работы с агентами: автоматическое подтверждение безопасных действий, редактирование предыдущих сообщений в диалогах, поддержка общих инструкций организации и расширенное управление MCP‑инструментами. Рассмотрим изменения подробнее.Автоматическое подтверждение безопасных действий

продолжить чтение

Нода загружена на 40%, а поды стоят: как найти причину через PSI в Kubernetes

Привет, Хабр!Управление ресурсами в Kubernetes десять лет держалось на двух числах в манифесте. Request определял, куда планировщик поставит под и сколько ему достанется при драке за процессор. Limit ограничивал сверху. Оба числа выставлялись один раз, менялись только пересозданием пода, а проверить их правильность было нечем, кроме графиков утилизации.

продолжить чтение

Почему ваша LLM тупеет на больших документах и как ее починить

Привет, Хабр!Меня зовут Андрей Бирюков. Я — независимый эксперт в области ИТ и ИБ, преподаю в учебных центрах и пишу статьи и книги. Когда Google анонсировал 2M контекста, а Anthropic подкинул еще 100K, наверняка многие подумали, что RAG теперь можно выкинуть на свалку истории. Зачем париться с этими чанками, эмбеддингами и всякой прочей ерундой, если можно просто кинуть в модель весь дамп википедии и спросить ее что угодно?

продолжить чтение

Как проверить postmortem, подготовленный LLM. Разбираем инцидент Cloudflare

«Все сервисы восстановили в 14:30» выглядит как обычная строка хронологии. Но для инцидента Cloudflare, который мы разберём ниже, она неверна: к этому времени в значительной степени восстановился основной трафик, а полное восстановление наступило позже.Такое сокращение меняет оценку последствий сбоя. Команда рискует пропустить часть проблем и меры, которые помогли бы их устранить.Если вы поручаете большой языковой модели, LLM, подготовить postmortem, письменный разбор причин и последствий сбоя, результату нужна содержательная проверка. Разберём её на материале

продолжить чтение

Запустить LLM локально: что считать до покупки видеокарты?

Всем привет, меня зовут Сергей Прощаев, я Tech Lead и руководитель направления Java/Kotlin‑разработки в FinTech & E‑commerce, преподаю на курсах разработки и архитектуры в ОТУС.В этой статье расскажу про домашний стенд для локального инференса

продолжить чтение

Я обучил собственную визуально‑языковую модель меньше чем на 1 млрд параметров

Каково это сегодня — с нуля собрать и обучить собственную визуально‑языковую модель? Именно этот вопрос и подтолкнул меня попробовать самому. Я взял базовую языковую модель, подключил к ней визуальный бэкбон и несколько часов обучал всё это на арендованной GPU в RunPod, пытаясь добиться от модели осмысленных описаний изображений.TL;DR:

продолжить чтение

123456...1020...21