Гайд по switchback‑экспериментам: длина окна, кластеризация ошибок и мощность
Привет, Хабр!Новая логика распределения заказов по курьерам выиграла A/B с запасом: время доставки минус восемь процентов, интервал узкий, p‑value с тремя нулями.Раскатали на сто, подождали две недели — время доставки осталось ровно там, где было. Логирование в порядке, сплит честный, пользователи делились случайно.Так ломается обычный тест в системах, где варианты дерутся за один ресурс.Курьер, доставшийся тестовой группе, отобран у контрольной, и разница надувается с обеих сторон сразу.Лечится это рандомизацией не по пользователям, а по времени:
InfoWatch Data Discovery меняет подход к файловому аудиту
В обновлении InfoWatch Data Discovery 2.2 появился модуль ML-кластеризации, который автоматически систематизирует 100% файлов и может многократно ускорить файловый аудит.
От «когда-нибудь» к работающему прототипу: как LLM дала идее шанс
Привет! Меня зовут Владислав Козлов, я тимлид аналитиков Business Security в Авито. Хочу поделиться с вами интересным опытом взаимодействия с LLM, который позволил мне дёшево и быстро проверить свою идею. А заодно — рассказать об интересном алгоритме кластеризации, который мы с моделью придумали и реализовали в виде библиотеки.
Как создавался агрегатор ИБ‑новостей: склейка сюжетов, семь признаков важности и порог по данным
Идея агрегатора новостей по кибербезопасности зародилась еще давно. Хотелось получать самое важное и без инфошума. LLM тогда ещё не были повседневным инструментом, и первую версию реализовал на модели суммаризации rut5_base_sum_gazeta, а важность считал textrank. Работало так себе. Потом появились сервисы, которые сами подбирают новости под настроенную ленту. Но оптимального решения так и не увидел — это либо про всё сразу, либо что‑то про одну узкую тему.
Как с чистой совестью бросить стартап, на который ушло 2 года
Привет, Хабр!Я фрилансер, но сегодня не про фриланс.Два года я делал свой проект — InnerCore, приложение для записи и юнгианского анализа снов. Сперва телеграм-бот, потом мобильное приложение, потом сделал веб-версию. По итогу было пятнадцать живых пользователей, некоторые даже платили! Продукт готов и работает! Осталось только запустить маркетинг и масштабировать....Но вместо этого я его закрываю.Сервер поработает ещё пару недель — можно потыкать. Исходники выложил в открытый доступ
Как у алгоритмов снижения размерности получается вас обмануть. Что происходит внутри PCA, t‑SNE и UMAP
Сколько глаз у человека? Два.А в сфере машинного обучения модели умеют видеть любую сразу тысячей или миллионами глаз. Мы живем в 3-х мерном пространстве(3D), и видим 2-х мерную картину мира. Модель, в свою очередь, обитает в цифровом пространстве. Она может видеть ваши 2D фото, 3D модель в Blender сразу со всех сторон и спокойно построить параллелепипед в 15D. В таком пространстве машинам вполне комфортно работается. Там они легко вычисляют семантическую близость
Агрегатор новостей заработал, когда я перестал доверять ИИ
С чего всё началосьПериодически в дороге и в свободную минутку перебираю новостные ресурсы в поисках свежих новостей. Поймал себя на мысли, что ресурсов у меня безумно много. Я больше трачу времени не на чтение, а на их перебор.Открываю один ресурс, второй, третий — реклама, баннеры, всплывающие окна. Не успеешь нажать на крестик, можно вообще улететь в неизвестном направлении. Вроде ищешь события, а натыкаешься на блогеров, экспертов, мнения, и особенно бесят душераздирающие истории представителей богемной тусовки.
Разбираемся в ML без воды: от базы до Attention. Часть 13: Кластеризация и k-means
В предыдущей главе мы рассматривали ситуацию, когда данных слишком много: большое количество признаков затрудняет их анализ, увеличивает вычислительные затраты и приводит к различным негативным эффектам, связанным с высокой размерностью. Для решения этой проблемы мы изучили понятие понижения размерности.Теперь перейдем к совершенно другой ситуации. Предположим, что с данными все в порядке: признаков достаточно, они хорошо описывают объекты, однако отсутствует целевая переменная (target)

