pyspark.

Как превратить LLM‑разметку в универсальный Spark‑пайплайн

TL;DR: мы сделали llm_markup — Spark‑приложение для массовой обработки данных через LLM API в существующем Airflow‑контуре. Источник данных, промпт, формат ответа, лимиты и целевая таблица задаются конфигурацией. Инструмент берет на себя батчинг, распределение запросов, контроль нагрузки на API, валидацию ответов и сопоставление результата с исходными строками.Меня зовут Дима Иванов, я дата‑инженер в Lamoda Tech. Я работал над llm_markup

продолжить чтение

От legacy до промышленной платформы: инженерная эволюция OSA в «Магнит»

Как мы провели проект через четыре «эпохи» - от ручных запусков на Windows‑планировщике до Spark + k8s на масштабе сети

продолжить чтение

Опыт Звука: как реализовать рекомендательную систему аудиокниг с использованием больших языковых моделей (LLM)

Всем привет! На связи Дмитрий Берестнев, Chief Data Scientist в HiFi-стриминге Звук

продолжить чтение