NN vs фракталы: может ли нейросеть выучить красивые математические функции?
В процессе прохождения курса от MIT про нейросети наткнулась на интересную тему, представленную одним из лекторов. Он задался вопросом: «А может ли нейросеть выучить функцию Вейерштрасса (непрерывная функция на вещественной прямой, не имеющая производной ни в одной точке)?». Я решила проверить это на практике. Мною было принято решение не останавливаться на фракталах, а поискать другие функции, обладающие интересными для математика свойствами: лестница Кантора, функция Римана (Томаэ) и др. В данной статье представлена только функция Вейерштрасса.
Что спрятано в 2500 слоях: как по весам нейросети восстановили MD5
Во многих ML‑головоломках в духе CTF участникам дают нейросеть — «чёрный ящик» и предлагают выяснить, что она делает. Когда в начале прошлого года мы задумались о собственной головоломке по машинному обучению, нам захотелось немного изменить привычный формат.
PVAD: как научить ИИ слышать нужного человека в шумной комнате
Представьте переговорную, где одновременно говорят несколько человек, а системе нужно понять, когда говорит целевой спикер, и выделить именно его голос. Задача нетривиальная, но именно её нам и нужно было решить.
Побеждаем OOM в PyTorch: как обучать гигантские графы на обычной видеокарте
Если вы обучаете графные нейросети или Knowledge Graph Embeddings на миллионы узлов, вы наверняка сталкивались с тем, что стандартный torch.optim.SparseAdam моментально забивает всю оперативную память или видеопамять.Я разработал маленький пакет Disk Sparse Adam (DSA) — Out-of-Core оптимизатор для PyTorch, который выносит состояния моментов (
Kazry — новая кусочно‑заданная активация
Привет, Хабр, в этой статье я хочу представить новую функцию активации для нейронных сетей под названием Kazry, которая по результатам тестов обогнала SiLU. Сразу перейдем к делу.Индустрия повсеместно использует активации типа SiLU из‑за их бесконечной дифференцируемости, но за это приходится платить высокую цену, в виде производной, которая глушит сигнал. Взглянем на график одной из самых популярных активаций — SiLU:
Своя GPT‑like LLM по WH40K с нуля. Часть 5: Интеграция с Hugging Face
Привет, Хабр! Меня зовут Владимир, и это пятая часть цикла статей по написанию и обучению небольшой decoder‑only LLM с нуля. В прошлых частях мы собрали и обучили модель LinguaLaboratoriumMechanicus — миниатюрную GPT‑like LLM во вселенной Warhammer 40K. В этой части упакуем её в формат Hugging Face: сделаем конфиг и обёртку под transformers, сохраним и зальём модель на Hub.Содержание циклаПодготовка и токенизация данныхТрансформерСборка и обучение LLM
Своя GPT-like LLM по WH40K с нуля. Часть 4: Дообучение на вопрос–ответ (SFT)
Привет, Хабр! Меня зовут Владимир, и это четвёртая часть цикла статей по написанию и обучению небольшой decoder-only LLM с нуля. В третьей части мы собрали LinguaLaboratoriumMechanicus, обучили base-модель на корпусе данных по Warhammer 40K и получили модель, которая умеет продолжать текст. Данная статья целиком посвящена этапу SFT - дообучению на датасете “вопрос - ответ”, чтобы модель могла вести диалог с пользователем, а не просто дописывать за него фразы.Содержание циклаПодготовка и токенизация данныхТрансформер

