Почему regex больше не находит клиентов в Telegram: препарируем 12 081 сообщение с помощью каскадного AI-скоринга
## TL;DR (BLUF)Классический мониторинг Telegram-чатов по ключевым словам («ищу разработчика», «нужен сайт», «требуется подрядчик») в 2026 году технически мертв: регулярные выражения пропускают 79.5% целевых коммерческих заявок и одновременно генерируют более 60% ложноположительного шума (самореклама исполнителей, вакансии, взаимопиар). В этой статье мы разбираем инженерную архитектуру трехуровневого каскадного пайплайна: от легковесных эвристик (2 мс) и мультиязычных эмбеддингов (15 мс) до LLM Decision Logic со строгой JSON-схемой. Все выводы подкреплены открытым бенчмарком на выборке из
Бесплатного интеллекта не бывает: кто оплачивает данные для LLM
Привет, Хабр! По первому образованию я юрист. Успел поработать в прокуратуре и арбитражном суде, потом ушёл в ИТ и последние 13 лет занимаюсь инфраструктурой, разработкой и DevOps. Сейчас строю MLOps-платформы.Этот опыт мешает мне спокойно читать споры об авторском праве и генеративном ИИ. Юрист видит пробелы учета прав в копировании чужих книг. Инженер — цепочку операций: crawler, raw storage, очистку, дедупликацию, training mix, веса, API. Между «скачали страницу» и «модель ответила пользователю» слишком много разных операций, чтобы обсуждать их одним словом «обучение».Отправной точкой для этого разбора стала
Как создавался агрегатор ИБ‑новостей: склейка сюжетов, семь признаков важности и порог по данным
Идея агрегатора новостей по кибербезопасности зародилась еще давно. Хотелось получать самое важное и без инфошума. LLM тогда ещё не были повседневным инструментом, и первую версию реализовал на модели суммаризации rut5_base_sum_gazeta, а важность считал textrank. Работало так себе. Потом появились сервисы, которые сами подбирают новости под настроенную ленту. Но оптимального решения так и не увидел — это либо про всё сразу, либо что‑то про одну узкую тему.
Я прогнал 60 тысяч составов продуктов через свой алгоритм. Вот что в еде на самом деле
Я делаю сервис, который наводится камерой на штрих-код и отдаёт светофор по составу плюс одну фразу человеческим языком. Побочный эффект такой работы — база. Сейчас в ней около 60 тысяч товаров из российских магазинов с разобранными составами.В какой-то момент я перестал смотреть на отдельные пачки и посмотрел на полку целиком. Ниже — цифры, грабли парсинга и два места, где алгоритм врал. Про механику, без ссылок и названий.Что считает алгоритмИИ в оценке нет. Это арифметика.
Книга: «Современная бизнес-аналитика. Увеличьте ценность данных с помощью Python и R»
Привет, Хаброжители!
Почему цена Bitcoin «сломалась»: разбор аномалий 2022–2026 с WhyTrend
Увидел провал на графике → открыл Google или Twitter → полдня собираешь версии "почему". Знакомо? Детектор аномалий сам по себе даёт только точки на оси времени, а вопрос "почему" как был ручным, так и остаётся.В этот раз я прогнал WhyTrend не на паре аккуратных точек из Google Trends, а на полном ряде BTC за 4.5 года — и заодно на двух разных LLM. Результат оказался неожиданным: модель меньшего размера дала в три раза больше настоящих объяснений, чем более крупная. Расскажу, что случилось и почему.Что запускалиДанные — дневные close BTC/USDT, 1680 точек без единого пропуска, с 1 января 2022 по 7 августа 2026. Ключевое слово одно — Bitcoin
Почему никто не объясняет аномалии во временных рядах?
Недавно встретились с коллегой за кружкой кофе, без всякой рабочей повестки. Он занимается Data Science, я — backend‑разработкой. Разговор как‑то незаметно, как это обычно бывает, свернул в сторону обсуждения рабочих нюансов, а самый обычный вопрос про очередной график в дашборде — закончился идеей проекта, который в итоге вырос в open‑source фреймворк.В какой‑то момент он сказал фразу, которая неожиданно зацепила:«Мы легко и быстро умеем находить аномалии. Но потом аналитик всё равно часами выясняет почему они произошли.»
BM25 против эмбеддингов, Protocol против наследования: как рождался фреймворк WhyTrend
В прошлой статье я рассказывал про WhyTrend — open‑source инструмент, который не просто находит аномалии во временных рядах, а пытается объяснить, почему они произошли: собирает внешний контекст (новости, Hacker News, Wikipedia) и формирует объяснение со ссылками на источники. Если коротко: идея выросла из наблюдения, что находить аномалии мы научились отлично, а вот объяснять их до сих пор приходится вручную — гуглить, листать Reddit и Slack, собирать гипотезу самому.
Гипотеза о Языке Мышления как альтернатива Искусственному Интеллекту
Длинный манифест, написанный обаятельным научпоп‑языком. Второе издание. Текст переработан и сокращен, и при этом удачно дополнен, в том числе картинками.50 лет назад была выдвинута гипотеза о Языке Мышления. Наверняка вы про нее не слышали — а зря. Классная штука, которая может перевернуть (и уже переворачивает) представление о возможных методах обработки информации, воплощенных в технологиях.
TAPe+ML: детекция, классификация и теперь и сегментация SOTA‑уровня в 0.1M параметров
кадр из фильма Космическая Одиссея 2001

