PyTorch. - страница 2

Своя GPT‑like LLM по WH40K с нуля. Часть 5: Интеграция с Hugging Face

Привет, Хабр! Меня зовут Владимир, и это пятая часть цикла статей по написанию и обучению небольшой decoder‑only LLM с нуля. В прошлых частях мы собрали и обучили модель LinguaLaboratoriumMechanicus — миниатюрную GPT‑like LLM во вселенной Warhammer 40K. В этой части упакуем её в формат Hugging Face: сделаем конфиг и обёртку под transformers, сохраним и зальём модель на Hub.Содержание циклаПодготовка и токенизация данныхТрансформерСборка и обучение LLM

продолжить чтение

Своя GPT-like LLM по WH40K с нуля. Часть 4: Дообучение на вопрос–ответ (SFT)

Привет, Хабр! Меня зовут Владимир, и это четвёртая часть цикла статей по написанию и обучению небольшой decoder-only LLM с нуля. В третьей части мы собрали LinguaLaboratoriumMechanicus, обучили base-модель на корпусе данных по Warhammer 40K и получили модель, которая умеет продолжать текст. Данная статья целиком посвящена этапу SFT - дообучению на датасете “вопрос - ответ”, чтобы модель могла вести диалог с пользователем, а не просто дописывать за него фразы.Содержание циклаПодготовка и токенизация данныхТрансформер

продолжить чтение

Python: как один из самых медленных языков стал королем нейросетей

Python. IT-курсы разрекламировали его как один из самых легких языков для входа в разработку, любители ИИ создают на нем свои первые нейросети, а некоторые сеньоры Java и C++ по-прежнему смотрят на него свысока, считая недостаточно строгим и производительным для «серьезной» разработки. В любом случае сегодня о Python знают все.Поскольку заметный рост его популярности пришелся на 2010-е годы, многие считают, что язык появился сравнительно недавно. Но это неверно: Python старше большинства современных веб- и ML-фреймворков, массовой мобильной разработки и нынешнего AI-бума.

продолжить чтение

Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM

Привет, Хабр! Меня зовут Владимир, и это третья часть цикла статей по написании и обучению небольшой decoder-only LLM с нуля. В первой части мы обучили токенизатор и собрали pretrain-датасет, во второй части реализовали класс Трансформер-блока. В этой части будем собирать и предобучать нашу LLM.Содержание циклаПодготовка и токенизация данныхТрансформерСборка и обучение LLM (вы находитесь здесь)SFT этап (дообучение на Вопрос-Ответ)

продолжить чтение

Почему «чем проще, тем лучше» не работает на ИИ-классификаторе

Micro F1 = 0.9358. Число, с которым можно спокойно закрывать задачу в трекере — если не разбираться дальше. Но стоило посмотреть на precision и recall по каждому из 15 классов отдельно, как выяснилось: качество части классов тестовый набор фактически не проверяет — для одного из них в test split вообще не было положительных примеров.Это разбор конкретного случая: как агрегированная метрика может скрывать классификатор, бесполезный именно там, где он важнее всего. И почему принцип KISS, на который я обычно опираюсь, в multi-label задачах работает не так прямолинейно, как кажется.Контекст: зачем вообще классификатор

продолжить чтение

Перенёс ByteTrack на GPU и ускорил мульти-камерный трекинг в 6 раз

Как я взял самый популярный трекинг-алгоритм, заставил его считать математику всех камер одним GPU-батчем — и по дороге трижды наступил на грабли, о которых стоит знать каждому, кто пишет real-time пайплайны на PyTorch.

продолжить чтение

Своя GPT-like LLM по WH40K с нуля. Часть 2: собираем трансформер

Привет, Хабр! Меня зовут Владимир, и это вторая часть цикла статей по написании и обучению небольшой decoder-only LLM с нуля. В первой части мы вытащили текст, обучили Byte-level BPE токенизатор и собрали pretrain-датасет. Теперь напишем сердце модели - трансформер.Содержание циклаПодготовка и токенизация данныхТрансформер (вы находитесь здесь)Сборка и обучение LLMSFT этап (дообучение на Вопрос-Ответ)Интеграция с Hugging FaceСодержание может меняться и дополняться ссылками по мере написания

продолжить чтение

Своя GPT-like LLM по WH40K с нуля. Часть 1: токенизируем Империум

Привет, Хабр! Меня зовут Владимир, и я давно хотел погрузиться во вселенную Warhammer40K. И в прошлом году я решил серьёзно подойти к этому вопросу - поискал в интернете с чего начать. Интернет подсказал, что единственный путь начать - почитать Ересь Хоруса. Дальнейший поиск показал

продолжить чтение

Они умеют думать. Как я искал (и нашёл) язык, на котором «думает» LLM

Это история одного эксперимента. Без хайпа про «сознание ИИ», но с настоящим результатом: внутри большой языковой модели есть слой, где мысль ещё не слово, а концепт. И этот концепт можно поймать за руку, подвигать, как ручку громкости, и прочитать по слогам.Вопрос, с которого всё началосьКогда LLM отвечает вам, она выдаёт токены — кусочки слов. Слева направо, по одному. Но до того, как родился токен, внутри сети прокатывается волна чисел — скрытые состояния, 3584 числа на каждом слое, 28 слоёв. Вопрос, который не давал мне покоя:

продолжить чтение

С-С++ в современном машинном обучении: традиционные роли и возможности нового стандарта

Привет, Хабр! Меня зовут Кирилл, я разработчик СХД в YADRO

продолжить чтение