Почему regex больше не находит клиентов в Telegram: препарируем 12 081 сообщение с помощью каскадного AI-скоринга
## TL;DR (BLUF)Классический мониторинг Telegram-чатов по ключевым словам («ищу разработчика», «нужен сайт», «требуется подрядчик») в 2026 году технически мертв: регулярные выражения пропускают 79.5% целевых коммерческих заявок и одновременно генерируют более 60% ложноположительного шума (самореклама исполнителей, вакансии, взаимопиар). В этой статье мы разбираем инженерную архитектуру трехуровневого каскадного пайплайна: от легковесных эвристик (2 мс) и мультиязычных эмбеддингов (15 мс) до LLM Decision Logic со строгой JSON-схемой. Все выводы подкреплены открытым бенчмарком на выборке из
Платформа — не самоцель: когда ML-разработку стоит унифицировать, а когда лучше остановиться, обсудили на «ИТ-Пикнике»
Машинное обучение часто воспринимают как работу над моделью: есть данные, алгоритм, обучение и результат. В крупных компаниях основная сложность постепенно перемещается в другое место. Одни и те же данные приходится готовить для разных проектов, модели — регулярно переобучать, эксперименты — проверять, а найденные решения — переносить между командами.На «ИТ-Пикнике» Сергей Кузнецов, руководитель разработки платформы рекомендаций и поиска MWS, показал на трех кейсах, почему в одних случаях лучше работать с полноценной ML-платформа, а в других — выгоднее остановиться на уровне библиотеки.
Пробиваем себя в In the Weights: ярмарка тщеславия в 2026
Гуглить свое имя уже неактуально, теперь информацию о себе стоит узннавать у ИИ. Экс-сеньоры OpenAI Томас Димсон и Джои Флинн (привет, Global Illumination) решили оцифровать паранойю по поводу цифрового следа и запустили In the Weights.Суть проще некуда: сайт задаёт 13 моделям один и тот же вопрос: «Кто такой ? Дай до 10 результатов с кратким описанием и уверенностью». Среди опрошенных — GPT-5.5, Opus 4.8, Grok, Gemini, Llama (обе, 70B и 1B), DeepSeek, Qwen и прочие. Никакого веб-поиска, только то, что модель выучила на трейне.
Почему AutoML не «магия», а способ выжить в промышленном ML
Когда в компании появляется первая ML‑модель, кажется, что самое сложное выбрать алгоритм и добиться хороших метрик. Но настоящий вызов начинается позже: когда моделей становится десятки, затем сотни, а скорость бизнеса начинает требовать обновлений не раз в год, а раз в недели.В Страховом Доме ВСК мы довольно быстро поняли: без стандартизации и автоматизации машинного обучения масштабирование превращается в хаос. Так у нас появился собственный AutoML‑фреймворк как ответ на реальные боли промышленного ML.Когда ML перестает быть «экспериментом»
Данные WhatsApp и Telegram для ML-моделей: тренд или серый рынок?
В этой статье я расскажу про новый тип данных для российского рынка - данные Whatsapp и Telegram: насколько они ценны и насколько легальны.
Как мы обучили модель прогноза ранней просрочки: логистическая регрессия vs градиентный бустинг
Всем привет! На связи дата-сайентисты стрима разработки моделей для корпоративного сегмента ВТБ — Андрей Бояренков, Иван Кондраков и Денис Дурасов.Как уже писали ранее в другой статье
ML-модель в поисках ЛПР
ЗавязкаДавайте рассмотрим вымышленную компанию «Орионик Групп» — холдинг, который объединяет несколько компаний, обеспечивающих полный производственный цикл и продажи.В головную компанию — «Орионик Групп» — входят:«Орионик Девелопмент» (девелоперский бизнес): управляет коммерческой и жилой недвижимостью. Генеральный директор: Артем Сергеевский.«Орионик Логистика» (транспорт и складские услуги): контрактная логистика, транспортные перевозки. Генеральный директор: Марина Маринина.
Пайплайн каскадных онлайн-моделей: как не запутаться в модулях и обрести дзен при внедрении многомодульных моделей
Привет, Хабр! На связи команда ML-инженеров из Департамента продвинутой аналитики Альфа-Банка (Лазаричева Екатерина, Дмитрий Гончаров, Николай Рябков, Илья Мясников и Асадян Гевонд), а также наши замечательные коллеги из «Глоубайт» (Альфия Харламова, Ростислав Изимов, Александр Малиновский

