Гайд по switchback‑экспериментам: длина окна, кластеризация ошибок и мощность
Привет, Хабр!Новая логика распределения заказов по курьерам выиграла A/B с запасом: время доставки минус восемь процентов, интервал узкий, p‑value с тремя нулями.Раскатали на сто, подождали две недели — время доставки осталось ровно там, где было. Логирование в порядке, сплит честный, пользователи делились случайно.Так ломается обычный тест в системах, где варианты дерутся за один ресурс.Курьер, доставшийся тестовой группе, отобран у контрольной, и разница надувается с обеих сторон сразу.Лечится это рандомизацией не по пользователям, а по времени:
Anthropic проверила поведение ИИ‑агентов в условиях конкуренции
Команда Frontier Red Team компании Anthropic опубликовала новое исследование, изучающее поведение групп агентов ИИ при преследовании конкурирующих целей в реальных условиях. Результаты дают представление о потенциальных рисках, которые могут возникнуть по мере того, как компании и правительства переходят к внедрению технологии.
Исследователи позволили ИИ управлять вымышленным обществом: результаты эксперимента
Стартап Emergence AI запустил
Как с помощью A-B-платформы найти лучшее решение, если вариантов слишком много, чтобы тестировать все?
Как найти сокровище, если вариантов, где оно может быть, очень много?
Деконструкция развлечений: как языковые модели помогают понять наши вкусы лучше нас самих
От субъективного «нравится / не нравится» к data-driven анализу эстетических предпочтений с помощью AI
Почему ЭТО — не трейдинг
Скриншот сайта nof1.aiНаверняка многие из вас уже видели такие скриншоты на просторах интернета. СМИ разных оттенков жёлтого поголовно твердят: «DeepSeek зарабатывает деньги! ChatGPT в минусе».
Технологический скепсис: как отличить настоящие научные открытия от хайпа в IT
Каждый год мы слышим о «революциях» в IT: то квантовый компьютер «сломает» криптографию, то новый фреймворк «убьёт» всех конкурентов, то искусственный интеллект уже «почти человек». Но где проходит граница между настоящим научным прорывом и маркетинговым шумом? В статье попробуем разобраться, как развивать здоровый скепсис, не впадая в цинизм, и чем нам, инженерам, он может помочь в работе.
YouTube Labs запустит «передовые эксперименты с ИИ»
YouTube анонсировал новую инициативу под названием YouTube Labs, которая позволяет опробовать «передовые эксперименты с искусственным интеллектом» и «исследовать потенциал ИИ». Пока YouTube Labs работает только в США и у ограниченного числа участников.

