Data Mining.

Почему никто не объясняет аномалии во временных рядах?

Недавно встретились с коллегой за кружкой кофе, без всякой рабочей повестки. Он занимается Data Science, я — backend‑разработкой. Разговор как‑то незаметно, как это обычно бывает, свернул в сторону обсуждения рабочих нюансов, а самый обычный вопрос про очередной график в дашборде — закончился идеей проекта, который в итоге вырос в open‑source фреймворк.В какой‑то момент он сказал фразу, которая неожиданно зацепила:«Мы легко и быстро умеем находить аномалии. Но потом аналитик всё равно часами выясняет почему они произошли.»

продолжить чтение

BM25 против эмбеддингов, Protocol против наследования: как рождался фреймворк WhyTrend

В прошлой статье я рассказывал про WhyTrend — open‑source инструмент, который не просто находит аномалии во временных рядах, а пытается объяснить, почему они произошли: собирает внешний контекст (новости, Hacker News, Wikipedia) и формирует объяснение со ссылками на источники. Если коротко: идея выросла из наблюдения, что находить аномалии мы научились отлично, а вот объяснять их до сих пор приходится вручную — гуглить, листать Reddit и Slack, собирать гипотезу самому.

продолжить чтение

Гипотеза о Языке Мышления как альтернатива Искусственному Интеллекту

Длинный манифест, написанный обаятельным научпоп‑языком. Второе издание. Текст переработан и сокращен, и при этом удачно дополнен, в том числе картинками.50 лет назад была выдвинута гипотеза о Языке Мышления. Наверняка вы про нее не слышали — а зря. Классная штука, которая может перевернуть (и уже переворачивает) представление о возможных методах обработки информации, воплощенных в технологиях.

продолжить чтение

TAPe+ML: детекция, классификация и теперь и сегментация SOTA‑уровня в 0.1M параметров

кадр из фильма Космическая Одиссея 2001

продолжить чтение

Еще одна мировая революция. Мы улучшили модель для любых CV-задач, добавив сегментацию. И еще лучше SOTA

кадр из фильма Космическая Одиссея 2001

продолжить чтение

OpenAI предложила властям США долю в 5% для защиты бизнеса

Компания OpenAI, оцениваемая почти в 852 миллиарда долларов, инициировала переговоры о передаче 5% своих акций правительству США. Генеральный директор стартапа Сэм Альтман рассчитывает, что такой шаг поможет снизить политическое давление и укрепить отношения с администрацией Дональда Трампа. Стоимость предлагаемого пакета активов оценивается в 43 миллиарда долларов.

продолжить чтение

audiogear: как разметить миллионы аудиозаписей для TTS

Конвейер на Python + Hydra, который превращает папку с аудио в богато размеченный датасет: качество речи, просодия, разборчивость, спикер, транскрипция — по колонке на запись. От одной видеокарты до кластера, карты под нагрузкой, и он не падает на «длинном хвосте» записей, на которых обычно рассыпается наивный скрипт. Привет, Хабр!Я автор блога От обезьяны к LLM. Делюсь с вами пайплайном по подготовке аудиозаписей для обучения моделей синтеза речи (TTS). Для обучения TTS систем нужно много данных. И не просто «аудио + текст», а аудио, про которое известно всё

продолжить чтение

Тихая-тихая мировая революция. Мы сделали модель распознавания для любых задач компьютерного зрения – и выше уровня SOTA

Мы не приверженцы теории марксизма-ленинизма (у нас своя теория), но иначе нашу разработку не назовешь. Вы можете к ней (к революции) присоединиться – просто начав пользоваться нашей моделью.

продолжить чтение

Книга: «Анализ данных с LLM. Текст, таблицы, изображения и аудио»

Привет, Хаброжители!

продолжить чтение

Критерии выживания и случайность — 5

Предыдущие статьи цикла.Случайность — другое имя БогаПовезло или сам добился? Как оценить?Критерии выживания и случайностьКритерии выживания и случайность - 2Критерии выживания и случайность - 3Критерии выживания и случайность - 4Сквозной тезис этой статьи держится на одном неудобном сочетании:

продолжить чтение

123456...10...11