time series.

Утечка на 3.5 часа вперёд: как модель обманывала саму себя полтора месяца — и как мы это поймали

Полтора месяца ML‑ансамбль в моей торговой системе показывал на бэктесте AUC 0.78 — солидное число для предсказания движения цены по 15-минутным свечам. В бою та же система в лучшем случае выходила в ноль. Разрыв между «отлично работает на истории» и «ничего не работает в реальности» — самый частый и обманчивый симптом в прикладном ML на временных рядах. Обычно за ним стоит одно из трёх: недообучение на новых условиях, изменившийся рынок или утечка данных.

продолжить чтение

650 млн точек, 3 поломки и PI System: технический разбор предиктивной аналитики на НПЗ (часть 2)

Часть 2 из 2. В первой части серии мы предсказали отказ насоса за 60 дней и выяснили, что годами чинили не то. Увидели, что материал встретил вашу живую реакцию, поэтому возвращаемся по горячим следам со второй частью. В этом материале, как и обещали, погружаемся в технику. Расскажем, что было под капотом, как решалась судьба насоса и с какими сложностями мы столкнулись.

продолжить чтение

Иллюзия 99% F1 в Time Series: как искажаются метрики в детекции аномалий и что показывает реальный тест 14 архитектур

Я занимаюсь внедрением ML в промышленности, поэтому задача детекции аномалий во временных рядах для меня близка и имеет огромную важность. В рамках исследовательского проекта мы искали адекватное SOTA-решение для мониторинга телеметрии (водоочистка, турбины, химические установки).Изучая свежие работы с конференций уровня A*, я обратил внимание на статью про Sub-Adjacent Transformer (SAT). В аннотации авторы заявляли метрику F1 в районе 99%.

продолжить чтение

Укрощаем рыночный хаос: Пишем Liquid Neural Network (LNN) на PyTorch для алготрейдинга

Если вы когда-нибудь пытались натравить классическую LSTM на минутные свечи волатильных активов, вы знаете эту боль. Сначала Loss красиво падает на трейне, вы предвкушаете покупку острова, а на тесте модель превращается в тыкву. Она либо предсказывает скользящую среднюю со сдвигом на один шаг, либо упирается в «стену» Loss = 0.693 (то есть −ln(0.5)), сводя всё к подбрасыванию монетки.

продолжить чтение

Новый TimesFM 2.5 от Google обошёл все модели в рейтингах

Google Research представила TimesFM 2.5

продолжить чтение

MOEX_AutoML VS ИИ (LLM)

Специализация всё ещё ключевой фактор точности прогноза? Всем привет! Меня зовут Андрей Бугаенко,  и в этой статье я расскажу, почему мы в Московской бирже считаем, что AutoML-подход, основанный на интеллектуальном выборе моделей и признаков (на примере MOEX_AutoML), эффективнее современных LLM в задачах численного прогнозирования.

продолжить чтение

RL-агент для алгоритмической торговли на Binance Futures: архитектура, бэктест, результаты

продолжить чтение

Кросс-валидация на временных рядах: как не перемешать время

Привет, Хабр!Сегодня рассмотрим то, что чаще всего ломает даже круто выглядящие модели при работе с временными рядами — неправильная кросс-валидация. Разберем, почему KFold тут не работает, как легко словить утечку будущего, какие сплиттеры реально честны по отношению ко времени, как валидировать фичи с лагами и агрегатами.Почему KFold — плохая идея для time-seriesKFold — штука классная… но только если твои данные не зависят от времени. Он был создан для мира, где каждый объект независим. Для задач классификации изображений или анализа табличных данных KFold

продолжить чтение

5 техник, применяемых в анализе временных рядов, которые должен знать каждый. Часть 2

В этом руководстве мы будем разбираться, как повысить качество прогнозирования с помощью машинного обучения, используя точные методы разделения данных, перекрестную проверку временных рядов, конструирование признаков и многое другое!Конструирование признаков для временных рядов: создание идеального рецепта данныхВ отличие от традиционных наборов данных, где объекты часто остаются статичными, данные временных рядов обладают уникальными временными паттернами, которые необходимо использовать для извлечения значимых признаков.

продолжить чтение

За гранью A-B: Синтетический контроль для оценки офлайн и онлайн экспериментов там, где A-B-тест невозможен

Привет! Я Настя — лид A/B Платформы в Wildberries. На протяжении всего карьерного пути меня интересует тема оценки эффектов. Для этого существуют различные инструменты, в числе которых как A/B‑тестирование, так и альтернативные способы, например, различные вариации Causal Inference.В этой статье я хочу поделиться примером проведения двух квази‑тестов в Wildberries с использованием Синтетического контроля (Synthetic Control), когда не получалось провести A/B‑тест, но все‑равно хотелось оценить эффект от изменений.Почему не А/B-тестирование?

продолжить чтение

12