валидация данных.

Модель не виновата: разбираем 3 громких ИИ-инцидента, которые случились из-за отсутствия архитектуры

продолжить чтение

Как я устал писать парсер под каждый прайс и сделал из этого библиотеку

С чего всё началосьУ нас на проекте была до боли знакомая многим картина: десятки источников прайсингов, и каждый — в своём формате. Один вендор присылает CSV с разделителем ;, другой — выгрузку из Excel, третий дёргает наш вебхук JSON-ом. Данные по сути одни и те же — аэропорт, марка топлива, цена, дата, — но:колонка цены называется то PRICE, то into-plane, то USD/gallon, то Цена (EUR/л);единицы разные: у одного литры, у другого галлоны, у третьего цена в центах;даты — 2026-01-15, 15/02/2026, 01.02.2026, как повезёт;аэропорт — то IATA-код, то ICAO, то «JFK / John F Kennedy» одной строкой;

продолжить чтение

Data Gravity и отравление выборки

Любой, кто хоть немного знаком с ИИ знает, что для эффективной работы искусственного интеллекта необходимы качественные данные

продолжить чтение

Список литературы тоже умеет галлюцинировать: как я делаю систему проверки научных источников

продолжить чтение

Как мы сделали полезным крупнейший русскоязычный датасет запросов к LLM

Привет! Меня зовут Роман Куцев, я основатель LLM Arena. У нас каждый день сотни людей общаются с языковыми моделями, тестируют, сравнивают, задают вопросы. В какой-то момент стало ясно: в этих логах — не просто сессии пользователей. Это — живая картина того, как люди используют LLM в реальности.Так родилась идея: собрать открытый, структурированный датасет промптов и дать AI-комьюнити инструмент, с которым можно не просто смотреть, но и исследовать, фильтровать, понимать логику запросов юзеров к LLM. 

продолжить чтение

fit() для новичков

Привет, Хабр! Эта статья для тех, кто только‑только погружается в машинное обучение и ещё не до конца понимает, что скрывается за интересным вызовом model.fit(). Вы, возможно, уже настраивали ноутбуки, пробовали разные датасеты и, может, даже словили пару неожиданных ошибок — и это нормально. Зачем копать глубже за fit()На старте может казаться, что достаточно написать:model = RandomForestClassifier(n_estimators=100) model.fit(X_train, y_train)— и всё заработает. Но стоит проекту вырасти, можно столкнуться с подвохами:Неожиданные NotFittedError при predict()Упавшая память на больших выборках

продолжить чтение