bert.

Почему «чем проще, тем лучше» не работает на ИИ-классификаторе

Micro F1 = 0.9358. Число, с которым можно спокойно закрывать задачу в трекере — если не разбираться дальше. Но стоило посмотреть на precision и recall по каждому из 15 классов отдельно, как выяснилось: качество части классов тестовый набор фактически не проверяет — для одного из них в test split вообще не было положительных примеров.Это разбор конкретного случая: как агрегированная метрика может скрывать классификатор, бесполезный именно там, где он важнее всего. И почему принцип KISS, на который я обычно опираюсь, в multi-label задачах работает не так прямолинейно, как кажется.Контекст: зачем вообще классификатор

продолжить чтение

Под капотом у MOLOT’а: обзор ML-модели для обнаружения вредоносного кода

Всем привет! На связи Максим Митрофанов, руководитель ML-команды Application Security в Positive Technologies.

продолжить чтение

Бесплатная защита от спама на почте с помощью ИИ фильтрации без VPN: многоуровневый метод с BERT и 550 МБ RAM

Вас тоже достаёт спам и реклама? Рекламу я блокирую через свой DNS сервер и локальными CSS фильтрами, а вот для почты пришлось придумать что-то другое.

продолжить чтение

Клиент — это тоже вектор? Как мы хотели улучшить ML‑модель, а построили similarity engine

продолжить чтение

Как решать задачу NER на практике

Всем привет! Меня зовут Максим. Я NLP‑инженер в red_mad_robot и автор Telegram‑канала Максим Максимов // IT, AI. Сегодня я расскажу о том, как решать задачу NER на практике. Теории будет по минимуму — вместо неё разберёмся, как решать задачу руками: подходы, ресурсы, код на Python. Сегодня в меню:Что такое NERПонимание целей и задачРабота с даннымиМоделированиеСоздание сервиса на основе модели Давайте начинать!Что такое NER

продолжить чтение

Создание системы по управлению цифровыми активами для базы данных PostGIS. Часть 3. Семантические связи между таблицами

Здравствуйте, уважаемые читатели Хабра! Это заключительная третья часть (первая и вторая) о создании основного функционала MVP (Minimum Value Product) системы по управлению цифровыми активами для базы данных PostGIS. Полный перечень возможностей разрабатываемого проекта представлен на картинке ниже.

продолжить чтение

Трёхстрочный Deep Learning: 20 примеров нейросетевой магии

В 2012 году команда из Торонто потрясла мир компьютерного зрения: их нейросеть AlexNet распознавала объекты на фотографиях лучше любого алгоритма, написанного вручную. Код занимал тысячи строк, требовал двух видеокарт и недель обучения. Сегодня вы можете превзойти AlexNet одной строкой кода, а модель загрузится за секунды.

продолжить чтение

Как мы сделали альтернативную систему метчинга товаров в X5 Digital: опыт, грабли и результат

Привет, Хабр! Меня всё ещё зовут Данила Федюкин, и я продолжаю быть тимлидом в X5 Digital. Руковожу командой, которая занимается метчингом. В прошлый раз я рассказывал, как мы перешли на собственную систему рекомендаций, а в этот раз о том, как делаем то же самое, но с метчингом товаров.X5 Digital – один из цифровых бизнесов Х5. Мы работаем в режиме Highload с RPS в 7500 и отвечаем за всю онлайн-доставку в более чем 1000 городах и населённых пунктах России.Этот канал постоянно растёт. В 2024 году покупатели Х5 совершили свыше 119,5 млн заказов продуктов на дом.

продолжить чтение

Фильтруем политику и нецензурщину: как в «Эвоторе» защищают клиентский чат

В мире высоких технологий все больше и больше компаний внедряют голосовых и чат‑ассистентов в различные сегменты рабочих процессов. Они помогают обрабатывать рутинные задачи, ускоряют взаимодействие с пользователями и снижают нагрузку на сотрудников. Компания «Эвотор» находится в числе тех, кто активно занимается разработкой ассистента поддержки на базе llm — Евы, которая уже помогает тысячам пользователей ежедневно.

продолжить чтение

Исследования показали, что попытка придать ИИ человеческое звучание происходит за счет потери смысла

продолжить чтение

123