lightgbm.

Утечка на 3.5 часа вперёд: как модель обманывала саму себя полтора месяца — и как мы это поймали

Полтора месяца ML‑ансамбль в моей торговой системе показывал на бэктесте AUC 0.78 — солидное число для предсказания движения цены по 15-минутным свечам. В бою та же система в лучшем случае выходила в ноль. Разрыв между «отлично работает на истории» и «ничего не работает в реальности» — самый частый и обманчивый симптом в прикладном ML на временных рядах. Обычно за ним стоит одно из трёх: недообучение на новых условиях, изменившийся рынок или утечка данных.

продолжить чтение

Слишком хороший признак: как звёзды, галактики и квазары научили меня не верить графикам

Слишком хороший признак: как звёзды, галактики и квазары научили меня не верить графикамНа Kaggle завершился шестой эпизод Playground Series, и тема на этот раз была астрономическая: по горстке чисел определить, что перед нами: звезда, галактика или квазар. По этому выпуску я решил собрать почти исчерпывающий разбор EDA.

продолжить чтение

Разбираемся в ML без воды: от базы до Attention. Часть 11: Градиентный бустинг

В десятой части при изучении случайного леса мы наткнулись на проблему: переход от одиночного дерева к лесу частично снизил дисперсию, но вопрос со смещением остался открытым. Сегодня мы перейдем к концепции градиентного бустинга, которая позволяет последовательно сводить смещение к нулю, и заодно разберем, как заставить деревья эффективно учиться на ошибках своих "предшественников".Градиентный бустинг

продолжить чтение

Поиск черной кошки в 2000-мерной темной комнате. Турнир алгоритмов машинного обучения

ЭпиграфЭксперимент завершен. Результаты выглядят так, будто я немного сломал законы физики привычного табличного ML.Может быть это соревнование, которого не должно было быть?Это приглашение к репликации.Спрятать иголку в стоге сена? Да!Добро пожаловать на мой маленький тестовый полигон.

продолжить чтение

Борьба с дисбалансом классов. Oversampling

ВведениеПривет, Хабр! На связи KozhinDev и ml-разработчик Приходько Александр. Это третья статья в цикле публикаций по теме борьбы с проблемой дисбаланса классов в машинном обучении. В первой статье

продолжить чтение

Борьба с дисбалансом классов. Undersampling

Привет, Хабр! На связи KozhinDev и ml-разработчик Приходько Александр. Это вторая статья в цикле публикаций по теме борьбы с дисбалансом классов в машинном обучении. В предыдущей статье

продолжить чтение

Борьба с дисбалансом классов. Стандартные методы

продолжить чтение

Лучшие фреймворки для машинного обучения в 2025 году

Сегодня ни один крупный проект в области машинного обучения (ML) не обходится без фреймворков — готовых наборов библиотек, в которых базовые алгоритмы уже оптимизированы для различных архитектур. Выбор правильного фреймворка не только упрощает разработку, но и определяет успех проектов по внедрению искусственного интеллекта.

продолжить чтение

Почему простой парсер не всегда решает задачу: мой опыт интеграции спортивных API

КонтекстВ рамках собственной системы спортивной аналитики я хотел получить real-time доступ к данным о движении коэффициентов — в частности, с платформы pickingodds.com. У сервиса интересная фича — визуализация графика изменения линии по каждому событию. Это потенциально полезный источник вторичных сигналов (например, для обнаружения аномалий, связанных с резкой коррекцией маркет-мейкеров).

продолжить чтение

В погоне за неизведанным: как ML-модель вредоносы искать училась

Всем привет! С вами Ксения Наумова. В Positive Technologies я исследую вредоносный сетевой трафик и совершенствую инструменты его анализа в экспертном центре безопасности (PT Expert Security Center

продолжить чтение

12