spark.

Как превратить LLM‑разметку в универсальный Spark‑пайплайн

TL;DR: мы сделали llm_markup — Spark‑приложение для массовой обработки данных через LLM API в существующем Airflow‑контуре. Источник данных, промпт, формат ответа, лимиты и целевая таблица задаются конфигурацией. Инструмент берет на себя батчинг, распределение запросов, контроль нагрузки на API, валидацию ответов и сопоставление результата с исходными строками.Меня зовут Дима Иванов, я дата‑инженер в Lamoda Tech. Я работал над llm_markup

продолжить чтение

Как ИИ меняет работу с корпоративными данными — итоги седьмого митапа MWS

Еще недавно ИИ в работе с данными использовали как вспомогательный инструмент. Нейросеть помогала написать запрос, найти информацию или подготовить отдельный документ. Теперь ей можно передать целый набор повторяющихся задач и подключить к корпоративным системам, каталогам и инструментам разработки. Часть работы выполняет агент, а специалист определяет правила, проверяет результат и принимает верхнеуровневые решения.Как меняется работа с корпоративными данными под влиянием ИИ, рассказали эксперты на седьмом митапе MWS.

продолжить чтение

От ANN к честному KNN на GPU: как мы пересобрали отбор кандидатов в рекомендациях Ozon

продолжить чтение

Работа с AI-ML-нагрузками в Kubernetes: плагин Headlamp для Kubeflow

продолжить чтение

CI-CD для данных и моделей на Airflow: как мы деплоим прогноз спроса в «Магните»

Привет, Хабр! Меня зовут Евстифеев Илья, я главный разработчик ML в команде MLOps FnR (Forecast & Replenishment) в MAGNIT TECH. Наша команда:Ислам Янгуразов

продолжить чтение

Только Сигма выбирают Delta Lake

Привет, Хабр! Меня зовут Дмитрий Кравчук, я занимаюсь всем, что связано с данными в блоке AI&ML MAGNIT TECH. Расскажу про фундамент прибыльных проектов, которыми мы занимаемся в департаменте. Это начало цикла статей о наших достижениях за 5 лет и планах на будущее.

продолжить чтение

Когда автоматизация становится умнее: как трансформеры изменили AutoDL в Альфа-Банке

Всем привет! С вами Артемий Лямин (@lyaminartemiy) и Иван Тренёв (@123-39

продолжить чтение

Простой Python, автоматический Spark: минус Kubernetes, плюс продуктивность

продолжить чтение

«Персональный ИИ-суперкомпьютер» от Nvidia поступит в продажу 15 октября

Nvidia 15 октября начнёт продавать «персональный суперкомпьютер для искусственного интеллекта» DGX Spark. Он позволит пользователям работать со сложными моделями искусственного интеллекта.

продолжить чтение

SRE в инженерии данных: профессия и ее перспективы

Всем привет! Меня зовут Александр Андреев, я SRE дата-инженер. Сегодня я хочу рассказать о необычной, но набирающей обороты роли в области обработки данных - SRE Data Engineer: кто это такой, чем занимается, как им стать, куда развиваться и какие перспективы у этой профессии. ВведениеПредставьте ситуацию: пайплайн данных, который должен готовить критически важные отчеты, внезапно сломался. Есть всего несколько часов (в самом лучшем случае - дней), чтобы понять, что произошло, исправить проблему и убедиться, что данные будут готовы вовремя. А затем нужно автоматизировать процесс так, чтобы эта проблема больше не повторялась.

продолжить чтение

12