Поисковые технологии. - страница 2

BM25 против эмбеддингов, Protocol против наследования: как рождался фреймворк WhyTrend

В прошлой статье я рассказывал про WhyTrend — open‑source инструмент, который не просто находит аномалии во временных рядах, а пытается объяснить, почему они произошли: собирает внешний контекст (новости, Hacker News, Wikipedia) и формирует объяснение со ссылками на источники. Если коротко: идея выросла из наблюдения, что находить аномалии мы научились отлично, а вот объяснять их до сих пор приходится вручную — гуглить, листать Reddit и Slack, собирать гипотезу самому.

продолжить чтение

Штрафуют ли AI-тексты? Прогнал свой корпус через 5 нейросетей и сверил с данными Ahrefs на 331k страниц

Тезис «за AI-текст понижают» (хорошо хоть не унижают) звучит как здравый смысл, и я сам долго в него верил. Но верить, честно говоря, разонравилось, поэтому решил проверить руками на каком-нибудь реальном замере. В итоге я прогнал корпус страниц через пять нейросетей, посмотрел, что предсказывает попадание в их ответы, и сверил вывод с недавним разбором Ahrefs на 331 тысячу страниц (даже Лев Толстой слегка перевернулся). На самом деле, если отбросить шутки, получилось даже интереснее, чем ожидал: наказание следует не за сгенерированный текст как таковой, а за отсутствие реального содержания. Так сказать, за водичку.

продолжить чтение

Как оценить стоимость ручного поиска документов в компании на 200 человек

В корпоративных системах обычно хорошо считают то, что приходит отдельным счётом: лицензии, серверы, внедрение, поддержку, подрядчиков. Эти расходы видно в бюджете, у них есть владелец, договор и понятная строка в финансовой модели.Но есть другой тип расходов — менее заметный. Он не приходит отдельным счётом, но каждый день съедает рабочее время сотрудников. Речь о ручном поиске документов, старых версий файлов, договоров, регламентов, презентаций, отчётов и решений, которые уже когда-то были созданы внутри компании.

продолжить чтение

Гарантия попадания в ответы нейросетей: почему нельзя это гарантировать и что измерять вместо этого

За последние пару месяцев мне трижды присылали коммерческое предложение с обещанием «вывести бренд в топ ответов ChatGPT». Один раз — с конкретной цифрой: позиция № 1 всего за 30 дней. Такие обещания я проверяю руками: беру API OpenAI, ставлю temperature = 0 и фиксированный seed, отправляю один и тот же промпт дважды подряд — и получаю разный текст. Я работаю с AI‑видимостью брендов и знаю механику генерации ответа изнутри, поэтому дальше разберу, почему гарантия здесь физически невыполнима и что можно измерить и продавать вместо неё.Почему вопрос гарантии вообще возникает

продолжить чтение

Всё, что перестало быть AI

Откройте бэклог любого крупного магазина и найдите там задачу «поправить сортировку в блоке „с этим товаром покупают“». Обычная задача, полдня работы, идёт в общей очереди. Двадцать лет назад ровно эта штука была темой статей в IEEE, а до того темой диссертаций. Сейчас это один из блоков задач. Владельца у него нет, есть компонент в джире.Ещё в том же бэклоге почти наверняка лежит «включить AI‑поиск», с приоритетом выше. Хотя поиск с исправлением опечаток и синонимами у вас работает с 2015 года и называется просто «поиск».Вот про этот зазор я и хочу написать.Эффект и его название

продолжить чтение

DuckDuckGo: поиск без слежки как бизнес-модель

DuckDuckGo — один из немногих поисковиков, который сделал приватность не маркетинговым лозунгом, а основой бизнеса. Сервис не хранит историю запросов, не создает профили пользователей и не раскрывает их данные. Несмотря на это, компания остается прибыльной и независимой. 

продолжить чтение

YaGo: как я хотел бесплатный self-hosted Tavily API, а в итоге воскресил YaCy

Всё началось не с мечты про «поисковик нового поколения». Мне понадобился быстрый self-hosted Tavily-compatible API для собственных рабочих и личных AI-решений: без оплаты за каждый запрос, без внешнего сервиса в обязательной цепочке и с индексом, содержимое которого контролирую я сам.Тут я вспомнил про YaCy. Когда-то я уже поднимал его ноду. Идея мне нравилась, а реализация - заметно меньше: Java, тяжёлая машина и примерно шесть секунд ожидания ответа на моей тогдашней установке. Для человека, который один раз нажал Enter, это ещё можно пережить. Для агента, делающего несколько поисков, уточнений и extract

продолжить чтение

ЕС обязал Google открыть доступ к данным Android и Google Search для конкурирующих ИИ-сервисов

Европейская комиссия обязала Google предоставить конкурирующим сервисам искусственного интеллекта более широкий доступ к данным операционной системы Android и поисковой системе Google Search.

продолжить чтение

Как быстро нейросети забывают источники: за месяц большинство теряется, но выжившие держатся долго

продолжить чтение

YouTube начал тестировать ИИ-поиск Ask YouTube

YouTube запустил тестирование ИИ‑поиска Ask YouTube — функции, которая позволяет задавать вопросы обычным языком и получать ответы на основе видео с платформы. Об этом сообщил руководитель сервиса Нил Мохан. 

продолжить чтение