Русские тексты. Работа с текстами. Предварительная обработка русских текстовых данных
Предварительная обработка текстовых данных: ключевые этапы и методыТекстовые данные — один из самых сложных типов данных для анализа из-за их неструктурированной природы и высокой вариативности. Чтобы превратить "сырой" текст в информацию, пригодную для машинного обучения или лингвистического анализа, требуется предварительная обработка. Этот процесс включает стандартизацию, очистку и преобразование текста, что повышает качество моделей NLP (Natural Language Processing). Рассмотрим основные этапы и методы.
Google тестирует в браузере Chrome ИИ-функцию для автоматической смены скомпрометированных паролей на сайтах
Google начала тестировать
Сэм Альтман (OpenAI) только что рассказал про GPT-5, GPT-4.5 и когда они выйдут (спойлер: скоро)
Сэм Альтман только что поделился новостям о грядущих разработках OpenAI в своем твиттере. OpenAI обновила свою дорожную карту, анонсировав выпуск моделей GPT-4.5 и GPT-5. Компания ставит целью упростить продуктовую линейку и сделать использование ИИ максимально интуитивным.Следующим шагом станет выпуск GPT-4.5, внутренне именуемой Orion. Эта модель станет последней без механизма цепочки рассуждений. Следующий шаг OpenAI - переход к более интегрированным системам.
Киссинджер не прав
«Стекло разбивается один раз» (арабская пословица).ПредисловиеВсе люди относительно проблемы ИИ делятся на три типа: 1) Видят проблему; 2) Увидят, если на нее указать; 3) Не увидят ни при каких обстоятельствах (сейчас или никогда — второй вопрос). Целевая аудитория данного эссе — люди первого типа. Они видят катастрофу, какую несет ИИ, и предлагают различные решения. Все их можно поделить на четыре группы:1) Политическая: контроль за развитием ИИ (международный и внутригосударственный)2) Этическая: создание дружественного человеку ИИ
OpenAI планирует в 2025 году завершить разработку первого собственного ИИ-чипа
OpenAI планирует завершить создание своего первого ИИ-чипа в 2025 году. По данным Reuters, таким образом компания рассчитывает сократить свою зависимость от Nvidia.
Топ-10 бесплатных нейросетей для генерации изображений: лучшие AI генераторы 2025 года
Изображение, сгенерированное с помощью Grok
Новая система безопасности на основе AI от Anthropic попала в руки хакеров за считанные дни
Всего за шесть дней с момента запуска проекта кому-то удалось обойти все механизмы безопасности, разработанные для защиты модели искусственного интеллекта Anthropic.Ян Лейке, бывший член команды по выравниванию OpenAI, ныне работающий в Anthropic, объявил на X, что один участник успешно преодолел все восемь уровней испытания. Коллективные усилия включали около 3700 часов тестирования и 300 000 сообщений от участников. Однако Лейке отмечает, что пока никто не нашел универсального джейлбрейка, который мог бы решить все уровни испытания сразу.

