Своя GPT‑like LLM по WH40K с нуля. Часть 5: Интеграция с Hugging Face
Привет, Хабр! Меня зовут Владимир, и это пятая часть цикла статей по написанию и обучению небольшой decoder‑only LLM с нуля. В прошлых частях мы собрали и обучили модель LinguaLaboratoriumMechanicus — миниатюрную GPT‑like LLM во вселенной Warhammer 40K. В этой части упакуем её в формат Hugging Face: сделаем конфиг и обёртку под transformers, сохраним и зальём модель на Hub.Содержание циклаПодготовка и токенизация данныхТрансформерСборка и обучение LLM
Своя GPT-like LLM по WH40K с нуля. Часть 4: Дообучение на вопрос–ответ (SFT)
Привет, Хабр! Меня зовут Владимир, и это четвёртая часть цикла статей по написанию и обучению небольшой decoder-only LLM с нуля. В третьей части мы собрали LinguaLaboratoriumMechanicus, обучили base-модель на корпусе данных по Warhammer 40K и получили модель, которая умеет продолжать текст. Данная статья целиком посвящена этапу SFT - дообучению на датасете “вопрос - ответ”, чтобы модель могла вести диалог с пользователем, а не просто дописывать за него фразы.Содержание циклаПодготовка и токенизация данныхТрансформер
Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM
Привет, Хабр! Меня зовут Владимир, и это третья часть цикла статей по написании и обучению небольшой decoder-only LLM с нуля. В первой части мы обучили токенизатор и собрали pretrain-датасет, во второй части реализовали класс Трансформер-блока. В этой части будем собирать и предобучать нашу LLM.Содержание циклаПодготовка и токенизация данныхТрансформерСборка и обучение LLM (вы находитесь здесь)SFT этап (дообучение на Вопрос-Ответ)
Своя GPT-like LLM по WH40K с нуля. Часть 2: собираем трансформер
Привет, Хабр! Меня зовут Владимир, и это вторая часть цикла статей по написании и обучению небольшой decoder-only LLM с нуля. В первой части мы вытащили текст, обучили Byte-level BPE токенизатор и собрали pretrain-датасет. Теперь напишем сердце модели - трансформер.Содержание циклаПодготовка и токенизация данныхТрансформер (вы находитесь здесь)Сборка и обучение LLMSFT этап (дообучение на Вопрос-Ответ)Интеграция с Hugging FaceСодержание может меняться и дополняться ссылками по мере написания
Как оценить библиотеку для ИИ-агентов без слепой проверки финального ответа
Сравниваем ревизии transformers по разным метрикамИИ-агенты для программирования
Своя GPT-like LLM по WH40K с нуля. Часть 1: токенизируем Империум
Привет, Хабр! Меня зовут Владимир, и я давно хотел погрузиться во вселенную Warhammer40K. И в прошлом году я решил серьёзно подойти к этому вопросу - поискал в интернете с чего начать. Интернет подсказал, что единственный путь начать - почитать Ересь Хоруса. Дальнейший поиск показал
Neural Networks for Beginners. Part Zero. Overview
Every time you say “Thank you” to a neural network, you trigger a pipeline that multiplies hundreds of matrices with billions of elements, burning as much electricity as an LED lamp in a few seconds.This is the first article in a small series dedicated to networks for AI/ML clusters and HPC.In this series, we will touch upon the principles of how models work and are trained, parallelization, DMA and RDMA technologies, network topologies, InfiniBand and RoCE, and we’ll also philosophize on the topic of general and special solutions.Specifically in this article, we will figure out what a neural network is, how it works, how it is trained, and most importantly, why it needs hundreds of expensive GPU cards and some kind of special network.The refrain of today’s story is: there is no magic in neural networks—it’s just a multitude of simple operations on numbers performed on computers with special chips. There is no magic in how they work, nor in the infrastructure on which they run.Let’s dive in!Table of Contents
Большое обновление Meta-Spider. Ручка неуверенности, сторож и фабрика обвязок, а так же новый модификатор поведения
Косплей обложки книги Нейромант ГибсонаЭто статья-продолжение про фреймворк Meta-Spider, который был описан здесь.

