Что такое дифференциал первого и второго порядка (Продвинутый уровень)
Данная статья подойдет всем любителям математики, кто хочет проверить себя в понимании, казалось бы, элементарного определения.ВведениеВ наше время уже в средней школе умные школьники знакомы с понятием производной и дифференциала. Никто не спорит, что их понимание не выделяется невероятной осознанностью, но я заметил, что даже большинство студентов не до конца чувствует тонкость данных определений. Поэтому я решил собрать свои силы и написать свою первую статью, поясняющую различие между дифференцируемостью, дифференциалами, дифференциалами по направлению, вторыми дифференциалами и так далее
Матричное дифференцирование в машинном обучении: градиент, якобиан и линейная регрессия
Всех приветствую.Я занимаюсь изучением темы машинного обучения и столкнулся с проблемой отсутствия нормальной, понятной информации по той или иной теме. Сегодняшнюю тему я изучал более 4,5 часов — и у меня просто сгорело, ведь нигде в лёгком доступе нет этой простой темы. Я собрал всё до кучи. Надеюсь, я буду последним, кто затупил на этом моменте. Если найдёте ошибки — прошу в комментарии.Зачем нужно матричное дифференцированиеВ обычном математическом анализе функция принимает одно число и возвращает одно число:
Разбираемся в ML без воды: от базы до Attention. Часть 3: Градиентный спуск
Во второй части мы рассмотрели аналитическое решение задачи линейной регрессии и наткнулись на ряд неприятностей — сингулярность, плохая обусловленность, вычислительная сложность и т.д.Логическим продолжением будет изучение (не побоюсь этого слова) сердца машинного обучения: градиентного спуска. ИтакГрадиентный спускТак как лучше уже не придумаешь, начнем с классического рассказа о пьяном альпинисте:
Как связывание эмбеддингов душит трансформеры и уничтожает градиенты
Если вы когда-нибудь собирали языковую модель с нуля, вы наверняка знаете про Weight Tying (Связывание весов). Этот трюк был предложен в 2016 году в статье "Using the Output Embedding to Improve Language Models" и популяризован OpenAI в архитектуре GPT-2.Суть предельно проста и математически изящна: мы берем матрицу входных эмбеддингов Win (размером Vocab_Size × Hidden_Dim) и используем её же транспонированную версию как выходной слой классификатора Wout
Дискретные дифференциальные операторы
Каждый раздел содержит по три подраздела: непрерывный случай, дискретный случай и кросс-корреляция.Производная первого порядкаНепрерывный случай. Производная функции
Эти пугающие производные, градиенты, матрицы Якоби и Гессе
В этой статье я поясню, как все эти принципы увязываются друг с другом, и покажу, для чего они могут применяться. Производные

