дрейф данных.

Как я построил ML‑пайплайн для поиска подозрительных транзакций и почему одной классификации оказалось мало

С ростом числа финансовых операций аналитикам всё сложнее вручную разбирать срабатывания систем финмониторинга — а большинство из них ложные.Привет! Меня зовут Максим Коцюба, я старший инженер по данным с опытом в финсекторе — ВТБ и Сбер, выпускник онлайн‑магистратуры «Инженерия данных

продолжить чтение

ML‑пайплайн как конечный автомат: от данных до аудита решений

Привет, Хабр! Меня зовут Андрей Бирюков. Я — независимый эксперт в области ИТ и ИБ, преподаю в учебных центрах и пишу статьи и книги. Сегодня мы поговорим об очень злободневной теме — отладке. Да, для машинного обучения эта тема тоже очень актуальна. Давайте представим, что вы выкатили новую модель в продуктив. Через неделю бизнес приходит с вопросом: «Почему в пятницу модель одобрила кредит клиенту с просрочкой, а в понедельник — отказала такому же?»

продолжить чтение

Не всё надо решать LLM. Где в продакшене побеждают бустинги, эмбеддинги и правила

Привет! На связи Катерина Лапаева, руководитель агентства в сфере AI – GIGASCHOOL. В мае наша команда проектировала AI-трек на одной из самых масштабных конференций для разработчиков на Урале – UWDC 2026, где мы запустили дискуссию. Обсудили, когда нужны большие языковые модели, а когда задачу проще, дешевле и надёжнее решить другими технологиями.

продолжить чтение

Побеждаем нестабильность данных

Привет, Хабр! Меня зовут Андрей Бирюков. Я — независимый эксперт в области ИТ и ИБ, преподаю в учебных центрах и пишу статьи и книги. Давайте на секунду представим почти реальную ситуацию: вы настроили модель прогнозирования спроса в ритейле. И сначала всё работало идеально, но потом наступила очередная «Черная пятница» (или локдаун, или новый конкурент на рынке) — и модель начала катастрофически ошибаться. То есть, данные изменились, модель устарела, а бизнес начал терять деньги. В этой статье мы посмотрим, какие проблемы возникают при таком изменении, и что с этим можно сделать.

продолжить чтение

Эксплуатация моделей (ModelOps)

Привет, Хаброжители! Сегодня мы поделимся с вами отрывком из книги: "Современная бизнес-аналитика. Увеличьте ценность данных с помощью Python и R". Статья посвящена ModelOps — набору практик для эффективного развертывания и эксплуатации моделей машинного обучения. Вы узнаете, как организовать полный жизненный цикл модели: от оценки и мониторинга до переобучения. В материале приведены практические примеры создания приложений для пакетной и онлайн-оценки с помощью R Shiny и Python Streamlit, а также дашборда для мониторинга производительности в реальном времени.

продолжить чтение

От диплома до продакшена: … Часть 7: Инфра, MLOps и уроки масштабирования

От диплома до продакшена: Как я создавал архитектуру ИИ-проекта для… Часть 7: Инфраструктура, MLOps и уроки масштабированияАвтор: Алексей Бобрешов, руководитель отдела искусственного интеллекта Категория: Искусственный интеллект, MLOps, управление проектами, масштабирование Время чтения: 13–16 минутЭто седьмая, заключительная часть серии. Для контекста по безопасности рекомендую Часть 6.Введение: почему модель — это ещё не продукт

продолжить чтение

Дрейф данных в машинном обучении

Дрейф данных (Drift Data) — это ситуация, когда статистические свойства входных данных для модели машинного обучения изменяются со временем. При дрейфе данных взаимосвязи между признаками и самой целевой переменной перестают быть действительными. Это может привести к низкой производительности модели, неточным прогнозам и даже к сбоям.

продолжить чтение

River: учим модель по одной строчке данных

Привет, Хабр! Сегодня я расскажу про библиотеку Python River, которая позволяет обучать модели машинного обучения в потоковом режиме. В классическом варианте мы собираем весь датасет целиком, делим на обучающую и тестовую выборки, обучаем модель, измеряем качество — и внедряем в прод. Здорово, если данных немного и они разом доступны. А если данные льются непрерывно?

продолжить чтение