ml.
Масштабирование LLM: от одного чипа до ЦОДа. Глава 3. Сколько ресурсов нужно для LLM?
Это продолжение цикла статей о масштабировании тренировки и инференса LLM. Предыдущая главаСчитаем количество операцийА теперь перейдем к чему-то более практическому, а именно к тому, сколько нужно FLOPs и байт для работы трансформера, той самой архитектуры, которая лежит в основе практически всех современных LLM. Подразумевается, что у вас уже есть представление о том, что такое архитектура трансформера, как работает механизм внимания и т.д.Давайте начнем с векторов x, y и матриц A, B, имеющих вот такие размеры, допустим один элемент занимает при этом один байт.
Масштабирование LLM: от одного чипа до ЦОДа. Глава 2. Шардинг
Это продолжение цикла статей о масштабировании тренировки и инференса LLM. Предыдущая глава находится по этой ссылке.Итак, с основами разобрались, давайте теперь разбираться с тем, как распихать матрицы по нескольким чипам, перемножить, а затем собрать это все в удобоваримый результат. По-умному это называется шардинг.
RAG для тех, кто разочаровался: почему retrieval ломается и как это починить
Вы собрали RAG-пайплайн: загрузили документы, нарезали на чанки, сгенерировали эмбеддинги, подключили векторную базу. Задаёте вопрос — модель отвечает уверенно и подробно. Показываете заказчику, тот в восторге. Потом начинается тестирование на реальных вопросах, и оказывается, что на половину из них система отвечает мимо: то находит не тот документ, то находит правильный, но не тот кусок, то вообще ничего релевантного не достаёт и модель уверенно галлюцинирует.
Почему 4 сеньёра могут быть эффективнее команды из 15 человек
Есть компании, которые верят в то, что уж лучше много джунов за копейки, чем несколько сеньоров за дорого.Очевидно, мнения могут быть разными, поэтому поделюсь своим опытом: 1. В компании Х у нас было 4 человека, которые ещё до эпохи ChatGPT с нуля за несколько месяцев собрали полноценный AI-стек: — fine-tune собственных LLM на своих датасетах — свой TTS/STT на своих датасетах — генерацию лиц и deepfake — MLOps-инфраструктуру и пайплайны
Как мы контролируем сборку печатных плат: опыт внедрения ML-модели на производстве
Привет, Хабр! Меня зовут Дмитрий Горбунов, я ведущий инженер в AI-дивизионе в YADRO, работаю в команде SmartFab. Мы решаем задачи на собственном производстве полного цикла Фаб Дубна, включающее цеха по производству многослойных печатных плат до 7 класса точности, линии поверхностного монтажа и автоматизированные конвейерные линии сборки и тестирования продуктов компании.
Выделение одного значащего признака из набора данных с помощью машинного обучения. Используется Apache Spark
Описание задачиВ первой части была создана инфраструктура для запуска машинного обучения. Там же была создана БД с данными для использования в примерах.В данной части будет искаться, какой тип файлов вызывает увеличение нагрузки. При этом, зная, какой именно тип файла был указан как вызывающий нагрузку.Будет использоваться машинное обучение в Apache Spark.Выборка исходных данных из БДНачать работу необходимо с выборки исходных данных для анализа. Структура БД описана в

