transformers. - страница 2

Neural Networks for Beginners. Part Zero. Overview

Every time you say “Thank you” to a neural network, you trigger a pipeline that multiplies hundreds of matrices with billions of elements, burning as much electricity as an LED lamp in a few seconds.This is the first article in a small series dedicated to networks for AI/ML clusters and HPC.In this series, we will touch upon the principles of how models work and are trained, parallelization, DMA and RDMA technologies, network topologies, InfiniBand and RoCE, and we’ll also philosophize on the topic of general and special solutions.Specifically in this article, we will figure out what a neural network is, how it works, how it is trained, and most importantly, why it needs hundreds of expensive GPU cards and some kind of special network.The refrain of today’s story is: there is no magic in neural networks—it’s just a multitude of simple operations on numbers performed on computers with special chips. There is no magic in how they work, nor in the infrastructure on which they run.Let’s dive in!Table of Contents

продолжить чтение

Большое обновление Meta-Spider. Ручка неуверенности, сторож и фабрика обвязок, а так же новый модификатор поведения

Косплей обложки книги Нейромант ГибсонаЭто статья-продолжение про фреймворк Meta-Spider, который был описан здесь.

продолжить чтение

От пульта до полотенца — учим робота искать всё, что угодно

Привет, Хабр! Меня зовут Татьяна Земскова, я аспирантка МФТИ и научный сотрудник команды Embodied Agents лаборатории Cognitive AI Systems AIRI. Областью моих научных интересов является компьютерное зрение для робототехники. Я изучаю, в частности, то, каким образом робот может использовать различные модальности (текст, изображения, сегментационные маски объектов) для лучшего понимания сцены и навигации. 

продолжить чтение

Умеют ли трансформеры водить машину

Трансформеры уже умеют писать код, генерировать тексты и рисовать картины. Но могут ли они управлять автономным автомобилем в реальных городских условиях, среди людей и других машин?

продолжить чтение

Делаем фреймворк Meta-Spider на основе мета-внимания

Spider-GwenЭто прямое продолжение статьи "meta-attention is all you need". Рекомендую ее прочитать перед тем как продолжить, но это необязательно, экскурс в архитектуру мы проведем.

продолжить чтение

Базовые нейросетевые модели для кредитного скоринга физических лиц

Всем привет! Мы команда прикладных исследований и разработки моделей глубокого обучения Альфа-банка. В этой статье мы хотели бы рассказать о наших самых актуальных разработках в области нейросетевых подходов к решению задачи кредитного скоринга физических лиц. Ранее мы уже писали на эту тему:Нейросетевой подход к моделированию карточных транзакцийНейросетевой подход к моделированию транзакций расчетного счета

продолжить чтение

Девять лет, как битломаны запустили ИИ-революцию

12 июня 2017 года группой битломанов из Google была опубликована статья под названием "Attention Is All You Need", в которой миру впервые были представлены трансформеры — новый тип нейронных сетей, которые обрабатывали всё, везде и сразу.Эту дату можно считать началом ИИ-революции, которую мы сейчас наблюдаем. Нам кажется, что все произошло практически мгновенно — однако девять лет уже пролетело!Вся фишка была в механизме внимания.

продолжить чтение

Meta-Attention Is All You Need

IntroductionIn this article I want to talk about an interesting finding from my experiments with language models, which I decided to call "meta-transformers".Either I found something genuinely interesting, or I mistook wishful thinking for reality. Only a technically competent outside observer can give an objective assessment, and that is why this text was published. Specialists in transformer architecture would be especially welcome here.

продолжить чтение

meta‑attention is all you need

ВведениеВ этой статье я расскажу о интересной находке во время моих экспериментов с языковыми моделями, которую я решил назвать «мета‑трансформерами».Или я нашел реально что‑то интересное, или выдал желаемое из действительное, а обьективную оценку может дать только (технически подкованный) внешний наблюдатель, поэтому этот текст и был опубликован. Особенно тут кстати будут спецы по архитектуре трансформеров.Веса моделей, исходники проекта + вся документация будут приложены в конце статьи (в главе исходники), на Hugging‑Face и Codeberg

продолжить чтение

Клиент — это тоже вектор? Как мы хотели улучшить ML‑модель, а построили similarity engine

продолжить чтение