эксперименты.

Гайд по switchback‑экспериментам: длина окна, кластеризация ошибок и мощность

Привет, Хабр!Новая логика распределения заказов по курьерам выиграла A/B с запасом: время доставки минус восемь процентов, интервал узкий, p‑value с тремя нулями.Раскатали на сто, подождали две недели — время доставки осталось ровно там, где было. Логирование в порядке, сплит честный, пользователи делились случайно.Так ломается обычный тест в системах, где варианты дерутся за один ресурс.Курьер, доставшийся тестовой группе, отобран у контрольной, и разница надувается с обеих сторон сразу.Лечится это рандомизацией не по пользователям, а по времени:

продолжить чтение

Anthropic проверила поведение ИИ‑агентов в условиях конкуренции

Команда Frontier Red Team компании Anthropic опубликовала новое исследование, изучающее поведение групп агентов ИИ при преследовании конкурирующих целей в реальных условиях. Результаты дают представление о потенциальных рисках, которые могут возникнуть по мере того, как компании и правительства переходят к внедрению технологии.

продолжить чтение

Как мы не обожглись на быстрых ML-экспериментах: опыт с 10% аудитории, холиварами с аналитиками и «лампой для лишая»

продолжить чтение

Исследователи позволили ИИ управлять вымышленным обществом: результаты эксперимента

Стартап Emergence AI запустил

продолжить чтение

Как с помощью A-B-платформы найти лучшее решение, если вариантов слишком много, чтобы тестировать все?

Как найти сокровище, если вариантов, где оно может быть, очень много?

продолжить чтение

Байесовские А-Б-тесты: связь с p-значениями

Показана численная близость -значений

продолжить чтение

Деконструкция развлечений: как языковые модели помогают понять наши вкусы лучше нас самих

От субъективного «нравится / не нравится» к data-driven анализу эстетических предпочтений с помощью AI

продолжить чтение

Почему ЭТО — не трейдинг

Скриншот сайта nof1.aiНаверняка многие из вас уже видели такие скриншоты на просторах интернета. СМИ разных оттенков жёлтого поголовно твердят: «DeepSeek зарабатывает деньги! ChatGPT в минусе».

продолжить чтение

Технологический скепсис: как отличить настоящие научные открытия от хайпа в IT

Каждый год мы слышим о «революциях» в IT: то квантовый компьютер «сломает» криптографию, то новый фреймворк «убьёт» всех конкурентов, то искусственный интеллект уже «почти человек». Но где проходит граница между настоящим научным прорывом и маркетинговым шумом? В статье попробуем разобраться, как развивать здоровый скепсис, не впадая в цинизм, и чем нам, инженерам, он может помочь в работе.

продолжить чтение

YouTube Labs запустит «передовые эксперименты с ИИ»

YouTube анонсировал новую инициативу под названием YouTube Labs, которая позволяет опробовать «передовые эксперименты с искусственным интеллектом» и «исследовать потенциал ИИ». Пока YouTube Labs работает только в США и у ограниченного числа участников.

продолжить чтение

12