датасет.

Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов

Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard, о которых и пойдет речь в этой статье.

продолжить чтение

В открытых иностранных датасетах для ИИ нашли песни и клипы российских исполнителей

Аналитики Национальной федерации музыкальной индустрии (НФМИ) исследовали базу данных проекта AI Watchdog, созданного журналом The Atlantic. Проект анализирует датасеты Laion‑Disco-12M от Laion с 12,3 млн треков с YouTube и Sleeping‑D 9M от Sleeping AI с 9,7 млн треков из того же источника. В указанных базах нашлись песни Басты, Димы Билана, Леонида Агутина и других российских музыкантов, пишут «Ведомости».Статистика выглядит следующим образом:Баста — 193 песни в Laion‑Disco-12M и 104 в Sleeping‑D 9M.Сергей Лазарев — 144 и 118 песен.Дима Билан — 140 и 119.

продолжить чтение

Почему датасет без единой ошибки может быть плохим датасетом

продолжить чтение

ML‑датасет для Data Scientist: практический гайд по проверке качества данных перед обучением модели

Всем привет, меня зовут Сергей Прощаев, я Tech Lead и руководитель направления Java | Kotlin разработки в FinTech & E‑commerce и преподаю на курсах разработки и архитектуры в ОТУС.В этой статье расскажу про восемь проверок датасета, которые нужно прогнать до того, как кто‑то в команде напишет model.fit().Пятница, релиз

продолжить чтение

«Ъ»: «Яндекс» представил концепцию датасета для проверки ИИ‑моделей на соответствие закону и духовным ценностям

«Яндекс» представил правительству концепцию набора тестовых заданий и эталонных данных для тестирования ИИ‑систем на предмет их соответствия духовно‑нравственным ценностям. Об этом со ссылкой на источник, близкий к Минцифры, и одного из участников совещания рабочей группы по регулированию и административным барьерам ИИ, пишет «Ъ». По словам источника издания, это нужно для оценки соответствия ИИ‑систем «духу времени и ценностям страны, а также их пригодности для использования в российских условиях».

продолжить чтение

Как я автоматизировал создание стикеров для соцсетей: локально обучаем стилевую LoRA для SD 1.5 на 30 картинках

Генерация красивых единичных артов давно перестала быть проблемой. Но как только возникает прикладная задача — например, сделать серию консистентных иллюстраций или заготовок для стикерпака в едином стиле — обычный промпт‑инжиниринг начинает буксовать. Закрытые модели дают высокое качество, но забирают контроль и навязывают свое видение.

продолжить чтение

Журналисты обнаружили датасеты с 22 млн охраняемых музыкальных записей, которыми обучали Suno, Udio и ИИ‑модели Google

Редакция The Atlantic в рамках проекта AI Watchdog

продолжить чтение

Ваш KYC не работает: почему цифровые подделки документов стали опаснее бумажных

Когда говорят о подделке документов, обычно подразумевают попытку обмануть человека. Но сегодня документы все чаще проверяют не сотрудники банков и служб безопасности, а алгоритмы цифрового онбординга, KYC и удаленной идентификации.Поэтому появились подделки нового типа — рассчитанные не на людей, а на компьютеры. Их задача не выглядеть идеально, а заставить систему распознавания извлечь нужные реквизиты и пропустить заявку дальше.Как выглядят такие атаки, почему существующие решения часто оказываются к ним не готовы и зачем мы создали открытый датасет цифровых подделок документов MIDV-DM — расскажем под катом.

продолжить чтение

Почему вы тратите время не на переговоры, а на чужую внутреннюю драму. Как проходят переговоры с крупными компаниями

Статья о наболевшем.Есть удобная, почти благородная формулировка: «рынок плохо воспринимает новые технологии». Она красивая, интеллигентная и вежливая, поэтому почти наверняка неправильная. Но проблема, конечно, вовсе не в рынке, а в том, что до рынка ещё надо добраться. А до него, как правило, сидит цепочка людей, которые либо не понимают, что им показывают, либо понимают слишком мало, но с очень большим апломбомРынок тут не при чем. просто сначала ты разговариваешь не с компанией, а с прослойкой людей, которые отлично умеют мешать, но плохо понимают – или не хотят понимать – что им показывают.

продолжить чтение

Трудности перевода: почему LLM не умеют писать нормальные докстринги на русском и как это исправить

продолжить чтение