data.

Бесплатного интеллекта не бывает: кто оплачивает данные для LLM

Привет, Хабр! По первому образованию я юрист. Успел поработать в прокуратуре и арбитражном суде, потом ушёл в ИТ и последние 13 лет занимаюсь инфраструктурой, разработкой и DevOps. Сейчас строю MLOps-платформы.Этот опыт мешает мне спокойно читать споры об авторском праве и генеративном ИИ. Юрист видит пробелы учета прав в копировании чужих книг. Инженер — цепочку операций: crawler, raw storage, очистку, дедупликацию, training mix, веса, API. Между «скачали страницу» и «модель ответила пользователю» слишком много разных операций, чтобы обсуждать их одним словом «обучение».Отправной точкой для этого разбора стала

продолжить чтение

Агент пишет код. Что тогда остаётся инженеру данных?

Здравый смыслВ работе инженера данных хватает повторяющихся задач: забрать данные из API, проверить структуру, преобразовать поля, записать результат в хранилище. Вокруг этого — настройки, тесты, сообщения об ошибках и документация.Такую работу удобно поручать Агенту. Например:

продолжить чтение

audiogear: как разметить миллионы аудиозаписей для TTS

Конвейер на Python + Hydra, который превращает папку с аудио в богато размеченный датасет: качество речи, просодия, разборчивость, спикер, транскрипция — по колонке на запись. От одной видеокарты до кластера, карты под нагрузкой, и он не падает на «длинном хвосте» записей, на которых обычно рассыпается наивный скрипт. Привет, Хабр!Я автор блога От обезьяны к LLM. Делюсь с вами пайплайном по подготовке аудиозаписей для обучения моделей синтеза речи (TTS). Для обучения TTS систем нужно много данных. И не просто «аудио + текст», а аудио, про которое известно всё

продолжить чтение

Книга: «Машинное обучение на табличных данных: XGBoost, глубокое обучение и ИИ»

Привет, Хаброжители!

продолжить чтение

Как мы встроили LLM в Data Quality и не потеряли контроль

Привет, Хабр! Меня зовут Макунина Арина, я аналитик и инженер данных в Just AI. Наша команда аналитики обожает, чтобы рутина в данных была максимально предсказуемой. Если что-то ломается, то должно быть понятно что, где, почему и что делать дальше. Когда мы поработали с Data Quality в продакшене, выяснилось, что правила качества сами по себе есть базовый минимум, но время утекает в две черные дыры.Первая — это эффект белого листа.

продолжить чтение

AI КОМП-АС — разбор фреймворка. М: Можем ли дойти?

Мы подошли к этапу, где наконец перекинем мостик от анализа текущего состояния организации и бизнес-целей к технологиям и имплементации процесса AI трансформации. Ниже я опишу 

продолжить чтение

AiConf 2026: переход от теории к практике

В 2026 году AiConf делает шаг от разговоров об AI к его практическому применению: ключевым элементом программы станет «стрим развития» — формат, где участники не слушают, а вместе решают реальные задачи. Это серия интерактивных треков, в которых за время конференции можно разобрать проблему, протестировать подходы и уйти с конкретным планом действий.

продолжить чтение

Прогнозирование цен на Airbnb в Нью-Йорке

Привет, Хаброжители! Мы открыли предзаказ на книгу «Машинное обучение на табличных данных: XGBoost, глубокое обучение и ИИ» Марка Райана и Луки Массарона. Предлагаем ознакомиться с главой 3 «Машинное и глубокое обучение». Чтобы сравнить машинное и глубокое обучение с точки зрения простоты, сопоставим два решения для конкретной задачи классификации табличных данных: прогнозирование того, будет ли объект недвижимости, предлагаемый в аренду на платформе Airbnb в Нью-Йорке (NYC), иметь цену больше или меньше средней цены в объявлениях Airbnb на этом рынке. Мы сравним:машинное обучение

продолжить чтение

Google представила Gemini Embedding 2 — нейросеть для поиска и сопоставления текста, изображений, видео и аудио

продолжить чтение

123