- BrainTools - https://www.braintools.ru -
Подробности о том, как один из самых авторитетных сайтов по анализу киноданных исчез за одну ночь, и почему любой веб-сайт, на который вы полагаетесь, более уязвим, чем вы думаете.

Если вы работаете в киноиндустрии или связаны с ней, есть большая вероятность, что вы использовали данные The Numbers в этом месяце, независимо от того, осознаёте вы это или нет.
Его данные, собранные вручную, отличаются высочайшим качеством, отслеживая кассовые сборы, бюджеты, домашнее видео и стриминг более чем 78 000 фильмов и 236 000 пользователей. Ежегодно его посещают более восьми миллионов человек, и он считается авторитетным источником информации [1] для журналистов, учёных, кинематографистов, рынков прогнозов и даже Книги рекордов Гиннесса.
И именно этот статус «лучшего из лучших» привёл к катастрофическим событиям марта этого года.
5 марта 2026 года веб-сайт TheNumbers.com [2] исчез.
Он был недоступен более недели без объяснения причин. Неделю спустя сайт снова появился, но в ужатом виде. Исчезли исторические графики, страницы отдельных фильмов и даже столь любимый конструктор отчётов.
Осталось лишь общее сообщение «мы восстанавливаем сайт, пожалуйста, потерпите немного», и интернет отреагировал, как обычно, — замешательством, гневом и теориями заговора.
Автор одной из теорий на Reddit даже предполагал, что это был преднамеренный обман, призванный парализовать бесплатный сайт и подтолкнуть людей к платным продуктам.
Три месяца спустя я поговорил с Брюсом Нэшем, основателем и генеральным директором The Numbers, о том, что произошло. Он описывает довольно неприятный и насыщенный событиями опыт [3]:
Мы получили множество гневных писем от людей, которые спрашивали: «Где эта страница, которая у вас раньше была?»
В его рассказе есть ряд моментов, которые должны обеспокоить любого, кто управляет интернетом, полагается на него или просто ценит его.
В пятницу, 17 октября 1997 года, математик и бывший разработчик программного обеспечения IBM Брюс Нэш запустил сайт Geocities, отслеживавший 300 фильмов.
Брюс описал запуск в эссе к 20-летию (которое сейчас сохранилось только в Интернет-архиве, по причинам, которые станут ясны позже):
Я нажал кнопку в базе данных Access, загрузил несколько HTML-страниц на Geocities и сделал короткое объявление на форумах Голливудской фондовой биржи, сообщив, что я начинаю анализировать кассовые сборы фильмов, чтобы помочь им выбрать акции кинокомпаний для торговли на HSX.

С этих скромных начинаний Брюс и команда, которую он создал вокруг сайта, превратили The Numbers в самый надёжный финансовый источник киноиндустрии.
В начале 2026 года база данных отслеживала 78 396 фильмов, 178 375 записей о прокате в кинотеатрах и 236 176 человек.
За время своего существования The Numbers сталкивался с огромными изменениями. Первые четверть века трафик был управляемым и в основном позитивным. Как говорит Брюс:
До появления ИИ у нас был человеческий трафик, в основном хорошо себя ведущие поисковые роботы, и несколько человек, сканирующих сайт для личных проектов. Если кто-то становился слишком жадным, мы могли его обнаружить и заблокировать.
За последние пару лет владельцы веб-сайтов по всему миру наблюдали изменения в своём веб-трафике. То, что изначально было только просмотром сайтов людьми, уступило место постоянно растущему числу ботов. К 2024 году автоматизированный трафик превзошёл человеческий, и всего месяц назад Cloudflare объявила, что запросы ботов достигли 57,5% от числа запросов веб-страниц.
The Numbers ощутил этот сдвиг в виде двух отдельных волн. Первая началась примерно в 2024 году:
Мы наблюдали значительное увеличение количества сканирований, когда обучение [4] ИИ присоединилось к поисковым роботам. Искусственный интеллект [5], используемый для сбора данных, как правило, ведёт себя менее корректно, чем поисковые системы, что увеличило объём задач по управлению сайтом и обеспечению его бесперебойной работы.
Вторая волна оказалась сильнее и нанесла больший ущерб:
Примерно в декабре 2025 года мы наблюдали ещё один большой всплеск трафика, который я связываю с агентным ИИ: сочетанием агентов ИИ, которые собирают данные с сайтов в ответ на запросы, и людей, способных писать собственные агенты для сбора данных с сайтов.
Как и любой сайт, насыщенный данными, к началу 2026 года The Numbers подвергался сильному давлению со стороны ботов ИИ, которые многократно собирали данные с его страниц в промышленных масштабах. Брюс говорит, что только 10% трафика приходится на людей, просматривающих сайт, а остальная часть — на ботов ИИ и автоматизированный трафик.

Это создало огромную нагрузку на сайт, но Брюс и его команда смогли принять меры для смягчения последствий. Одним из самых умных решений стало общение с роботами на их собственном языке:
На сайте есть информация, предназначенная для чтения LLM, чтобы они могли подсказать, «как лицензировать данные», а не «как парсить веб-сайт». Это имело огромный эффект. Сейчас мы получаем, вероятно, в десять раз больше запросов на лицензирование.
Но смягчение последствий — это не то же самое, что избегание проблемы. С декабря по начало марта команда изо всех сил пыталась поддерживать работу сайта под нагрузкой. Брюс подсчитал, что:
Около 90% нашего времени ушло на поддержание работы существующего сайта, в то время как в свободное время мы работали над новой, улучшенной системой.
Проблема усугублялась тем, что возраст сайта составляет тридцать лет, и это около 160 000 исходных файлов, обслуживающих примерно 2 миллиона страниц.
Затем, рано утром в четверг, 5 марта, серверы вышли из строя.
Команда пыталась понять, что произошло, первоначально предполагая, что это из-за огромного объема трафика от ИИ. Похоже, виноват был ИИ… но, возможно, не только так, как они думали сначала.
В потоке трафика от агентов журналы сайта показали нечто более целенаправленное, чем просто парсинг. Как описывает это Брюс:
Некоторые из них использовали сайт, применяя легитимные URL-адреса, другие искали лазейки, скорее всего, чтобы получить доступ к данным до того, как они появятся на сайте, или чтобы манипулировать данными, предоставляемыми пользователям.
По совету друга, работающего в сфере кибербезопасности, старый сервер оставили отключённым. Навсегда. Восстановление резервных копий и поддержание тридцатилетнего сайта в рабочем состоянии означало бы защиту 160 000 устаревших файлов от злоумышленников, которые потратили месяцы на их изучение.
Команда в спешке создала базовую версию сайта на новой инфраструктуре, которая, по крайней мере, могла продолжать публиковать последние данные о кассовых сборах, пока они анализировали произошедшее и определяли дальнейшие действия. Сайт был запущен в пятницу, 13 марта.
На первый взгляд, The Numbers может показаться неочевидной целью. Компания не собирает данные кредитных карт, и у неё нет никаких ценных данных о клиентах, которые можно было бы продать в даркнете. Это небольшая независимая компания, которая публикует информацию о доходах от фильмов.
Как можно рассчитывать на заработок, имея только закрытый доступ к их сайту?
Если вы ещё не догадались, это связано с рынками прогнозов.
Polymarket выдаёт еженедельные рынки прогнозов на первые выходные проката и называет The Numbers главным источником достоверной информации:
Данные «Ежедневные показатели кассовых сборов», которые можно найти на вкладке «Кассовые сборы» на странице The Numbers, посвящённой фильму, будут использованы для решения этого вопроса после того, как будут окончательно определены значения за 3-дневные первые выходные проката.
Суммы на любом отдельно взятом рынке выходных дней скромны по меркам финансовых рынков, обычно исчисляются десятками и сотнями тысяч долларов, а на рынках кассовых сборов в режиме реального времени могут достигать нескольких миллионов.
Если бы вы могли видеть данные The Numbers раньше всех каждую неделю, у вас было бы значительное преимущество перед всеми остальными трейдерами — узнавая ответы немного раньше публикации, вы могли бы совершать сделки на опережение.
В такой ситуации трудно с уверенностью сказать, что произошло. Мы знаем, что логи показали месяцы автоматического зондирования и сбора данных с сайта, но что в конечном итоге привело к его закрытию и кто это сделал, остаётся открытым вопросом.
Однако теория о том, что кто-то использовал ИИ для получения преимущества на рынке прогнозов, вполне правдоподобна. Опыт The Numbers показывает нам, что:
Мы живем в мире, где сайт со статистикой фильмов стоит взламывать, потому что рынки прогнозов позволяют любому превратить практически любые данные в деньги.
Взлом веб-сайтов теперь может организовать любой, имея дешёвую подписку на ИИ.
Интернет в его нынешнем виде невероятно уязвим перед лицом масштабных роев управляемых ИИ-ботов.
В ноябре 2025 года Anthropic (лаборатория ИИ, разработавшая Claude) опубликовала отчёт о том, что она назвала первой задокументированной кибершпионской кампанией, организованной ИИ. Группа, спонсируемая государством, использовала свой инструмент программирования для атаки примерно на 30 организаций, при этом ИИ выполнял от 80% до 90% работы, а люди вмешивались лишь в 4-6 точках принятия решений в каждой кампании.
Собственный вывод Anthropic был следующим:
Препятствия для проведения сложных кибератак существенно снизились, и мы прогнозируем, что они будут продолжать снижаться.
В более раннем отчёте об угрозах Anthropic выразилась ещё яснее:
Преступники с небольшим количеством технических навыков используют ИИ для проведения сложных операций, таких как разработка программ-вымогателей, для которых ранее требовались годы обучения.
Тем временем автономный инструмент для пентестинга с использованием ИИ под названием XBOW занял первое место в американском рейтинге HackerOne, который составляется по результатам поиска уязвимостей (ранее это были только люди), обнаруживающих уязвимости в реальных компаниях за вознаграждение, и представил почти 1060 таких уязвимостей.
Получение доступа к веб-сайту тридцатилетней давности со 160 000 устаревших файлов — это именно тот тип известной уязвимости, которую инструменты ИИ сделали доступной для исследования. Барьер экспертных знаний, который когда-то защищал небольшие сайты от всех, кроме самых целеустремленных злоумышленников, в значительной степени исчез.
Брюсу и его команде относительно повезло. Несмотря на то, что весь их сайт был отключён за одну ночь, они смогли продолжить работу. Сайт The Numbers всегда был бесплатным, и в последние несколько лет он не сильно зависел от рекламы, поэтому сбой не уничтожил источник дохода, от которого они зависели.
Их основной бизнес связан с продажей больших объёмов данных через сервис OpusData, подготовкой аналитических отчётов для кинематографистов и инвесторов, а также публикацией бизнес-отчёта — и все это в совокупности не повлияло на работу общедоступного сайта.
Но им необходимо создать совершенно новый веб-сайт с нуля, чтобы разместить эти 78 396 фильмов, 178 375 записей о релизах и 236 176 пользователей. Восстановление сайта из резервной копии было невозможно, как отмечает Брюс:
Было совершенно очевидно, что мы не можем просто снова запустить этот сервер, потому что он неизбежно снова выйдет из строя, возможно, в течение нескольких минут.
Именно поэтому сайт вернулся в минимальной версии в середине марта, и поэтому функции возвращаются постепенно, а не все сразу.
Сейчас команде приходится переосмысливать, что вообще означает общедоступный веб-сайт в 2026 году. Анализ Брюса показывает, что раньше The Numbers обслуживал две аудитории (людей и поисковые системы), а теперь обслуживает примерно шесть: людей, поисковые системы, обучающие запуски LLM, трафик ИИ на основе подсказок, агентный ИИ и игроков на рынке прогнозов. У каждой из них разные потребности [6] и разный профиль трафика. Как он сам говорит:
Мы перешли от мира, где управление веб-сайтом означало сосредоточение на трех вещах (контент, реклама и SEO), к примерно восьми-десяти различным факторам, влияющим на каждое дизайнерское решение.
Цель, по его словам, состоит в том, чтобы поддерживать все шесть целевых аудиторий с помощью новых сервисов OpusData и онлайн-функций для подписчиков Business Report, и, что важно, помочь обычным пользователям сайта восстановить данные, которые он всегда предоставлял, некоторые из них в новой и улучшенной форме.
Честно говоря, довольно опасным. Настолько, что владельцы сайтов, такие как Брюс, вынуждены сомневаться в ценности чего-то, что потребует столько времени и денег на создание и защиту.
Cloudflare, которая защищает огромную долю веб-сайтов в мире, публикует данные о том, сколько страниц каждая платформа ИИ сканирует для каждого посетителя, которого она отправляет обратно на просканированные сайты.
Google сканирует около пяти страниц для каждого посетителя, которого он отправляет вам. OpenAI сканирует более 1000. Anthropic сканирует более 38 000 страниц на каждого посетителя, которого он перенаправляет.

Обратите внимание [7], что шкала логарифмическая, то есть каждый шаг внизу в десять раз больше предыдущего, потому что в противном случае различия были бы слишком велики, чтобы я мог включить их в один график.
В истории интернета до настоящего времени принцип открытой сети заключался в том, что в обмен на разрешение поисковым роботам читать ваш сайт они направляли бы к вам читателей. Но теперь этот обмен больше не работает. Количество ботов резко возросло, и они больше никого не перенаправляют.
Когда этот поток данных направлен на небольшой сайт, это может значительно увеличить счёт за трафик и, возможно, даже привести к сбою. Сайты, которые могут быть связаны с опытом Брюса, включают:
Read the Docs, некоммерческая организация, размещающая документацию для программного обеспечения с открытым исходным кодом, которая наблюдала, как один поисковый робот за месяц загрузил 73 терабайта заархивированного HTML-кода, что обошлось ей более чем в $5000 за трафик.
База данных руководств по ремонту iFixit зафиксировала миллион обращений от поискового робота Anthropic за один день.
Компания Triplegangers, состоящая из семи человек и занимающаяся продажей услуг 3D-сканирования, была отключена от сети в рабочее время ботом OpenAI, что, по словам её генерального директора, было «по сути, DDoS-атакой». Основатель сервиса хостинга кода SourceHut сообщил, что тратит «от 20 до 100% своего времени в неделю» на борьбу с поисковыми ботами, сталкиваясь с «десятками кратковременных сбоев в неделю».
Редактор новостного сайта Linux LWN, который описал трафик поисковых роботов с «буквально миллионов IP-адресов» и заключил: «это распределённая атака типа “отказ в обслуживании”».
Когда проект с открытым исходным кодом GNOME измерил свой трафик, примерно 97% его пришлось на ботов.
Университетская библиотека заблокировала 16 000 IP-адресов за 48 часов, чтобы сохранить свой каталог в сети.
Фонд «Викимедиа», управляющий «Википедией», сообщил в апреле 2025 года, что на ботов приходится около 35% просмотров страниц, но не менее 65% самого дорогого трафика, поскольку поисковые роботы массово считывают малоизвестные страницы, к которым редко обращаются люди.

Шесть месяцев спустя произошла вторая волна спада: количество просмотров страниц «Википедии» людьми упало примерно на 8% в годовом исчислении, поскольку те всё чаще получают знания из сводок ИИ, не посещая саму энциклопедию. Машины также захватывают контент и читателей в промышленных масштабах.
Инструменты ИИ — одни из самых мощных и разрушительных вещей, когда-либо созданных человечеством. И они эффективно проверяются общественностью в режиме реального времени в реальном мире. Когда Манхэттенский проект пытался оценить мощность своих атомных технологий, они не делали этого, рассылая всем технические характеристики каждое утро и наблюдая, какие дома взрываются.
Мир, который мы строили до сих пор, невероятно плохо подготовлен к мощи и масштабу моделей искусственного интеллекта, к которым у нас всех есть доступ.
Я не хочу, чтобы это звучало как односторонняя кампания по запугиванию против ИИ. В ИИ много хорошего и того, что он может сделать для человечества. Но нам нужно учитывать особенности мира, в который мы сейчас вступаем.
В первую очередь ломаются те механизмы, которые были разработаны для старого интернета. Открытый интернет был построен на таких предположениях, как то, что посетители — это в основном люди, что трафик примерно соответствует количеству читателей, и что стоимость обслуживания вашего сайта связана с ценностью, которую вы получаете от его обслуживания. Каждое из этих предположений сейчас устарело.
Год назад Cloudflare запустила модель оплаты за сканирование, позволяющую сайтам взимать плату с ИИ-сканеров за каждую страницу. На прошлой неделе компания пошла ещё дальше, объявив о модели оплаты за использование, в которой издатели получают деньги, когда их контент фактически появляется в ответе ИИ, и заявив, что с 15 сентября страницы её клиентов с рекламой будут по умолчанию блокировать неоплачиваемые «смешанные» сканеры.
Успех всего этого зависит от того, будут ли компании, занимающиеся ИИ, сотрудничать, а не обходить систему. Но, как сказал мне Брюс, кто-то должен попытаться.
Давайте на мгновение отвлечёмся от конкретных деталей и рассмотрим, что здесь произошло.
Любимый, полезный, бесплатный веб-сайт, тщательно управляемый компетентным и честным человеком почти тридцать лет, был раздавлен двумя особенностями новой экономики ИИ.
Неустойчивый трафик машин обрушился на него сверху, и, по всей вероятности, его вывел из строя злоумышленник, движимый финансовыми мотивами и работающий в мире, где взлом веб-сайтов стал проще простого.
Бизнес и средства к существованию Брюса сохранились только потому, что веб-сайт не был его единственным источником дохода.
Другим повезло меньше. Буквально на прошлой неделе немецкая текстильная компания ZEGO, проработавшая 37 лет, подала заявление о банкротстве после того, как кибератака в марте остановила её производство на шесть недель. В отличие от The Numbers, у них не было другого бизнеса, на который можно было бы опереться.
В интернете полно независимых архивов, любительских баз данных, местных новостных сайтов, форумов, справочников. Десятилетия накопленных человеческих усилий, работающие на старом коде, поддерживаемые небольшими командами или отдельными людьми, тихо хранят гораздо больше наших общих знаний, чем кто-либо признаёт.
The Numbers возвращается, став лучше, чем прежде. Я бы призвал вас продолжать использовать его, продолжать поддерживать его, и, если вы один из тех многих, кто в ярости [8] написал Брюсу по поводу отсутствующей страницы, возможно, стоит отправить более вежливое письмо теперь, когда вы знаете, почему она отсутствовала.
Автор: maybe_elf
Источник [9]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/33506
URLs in this post:
[1] источником информации: http://www.braintools.ru/article/8616
[2] TheNumbers.com: http://TheNumbers.com
[3] опыт: http://www.braintools.ru/article/6952
[4] обучение: http://www.braintools.ru/article/5125
[5] интеллект: http://www.braintools.ru/article/7605
[6] потребности: http://www.braintools.ru/article/9534
[7] внимание: http://www.braintools.ru/article/7595
[8] ярости: http://www.braintools.ru/article/6134
[9] Источник: https://habr.com/ru/articles/1062474/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1062474
Нажмите здесь для печати.