трансформеры.

Скрытая структура генерации текста ИИ. Как контекст меняет продолжение

Иногда нескольких слов достаточно, чтобы довольно точно предположить, что будет дальше. В других случаях для этого требуется больше информации.

продолжить чтение

Как использовать фреймворк Perseus для решения задач

продолжить чтение

Где счетный бейзлайн бьет трансформер: честное сравнение на русских отзывах

продолжить чтение

Черный лебедь в мире LLM или когда убьют трансформер?

И снова возвращаюсь к теме больших языковых моделей. В своей достаточно старой статье я писал, что текущая архитектура БЯМ(LLM) — это гонка в тупик. Наблюдения за прошедшее время только укрепляют меня в этом мнении. Но сегодня хочу поговорить о другом, а что если тупик — это не конец пути, а просто барьер, за которым нас ждет технологическая революция? И почему те, кто сейчас вкладывает сотни миллиардов в дата-центры, сделают всё, чтобы эта революция не случилась? Разберем по порядку.Токены — фундаментальный костыль архитектуры

продолжить чтение

Снятся ли трансформерам электроовцы

продолжить чтение

Откуда взялся ИИ и причем тут слово перцептрон

продолжить чтение

Что вы увидели на картинке первым? Спрашиваем трансформер

Наверняка многие видели картинки-тесты, которые предлагают по тому, что первым бросилось в глаза определить характер, какое полушарие доминирует или что-то еще. Обычно на этих изображениях находится несколько объектов или один объект меняется в зависимости от "угла" обзора. А что будет, если попросить трансформер описать эти картинки? Что "увидит" он и на что он "обратит внимание"?Для мини-исследования была выбрана модель BLIP (Bootstrapping Language-Image Pre-training) от Salesforce (см. гитхаб с полным кодом). Как трансформер, эта нейросеть разрезает картинку на фрагменты (патчи) и преобразует их в токены:

продолжить чтение

Эксперимент: заставляем трансформер читать палиндромы через Чебышёва и комплексные экспоненты

Большинство нейросетей работают с числами и читать как человек они не умеют, поэтому инженерами были придуманы способы помочь нейросети уловить не только смысл конкретного слова, но и всего предложения. Для достижения такой цели используется positional encoding, то есть помимо отдельных слов нейросети дают их порядок в тексте. В данной статье приведен сравнительный анализ чисто смысловых векторов, линейного базиса (порядковый номер слова), базиса Фурье (синусы и косинусы), комплексного (экспоненты) и полиномы Чебышева для кодирования двух английских фраз.

продолжить чтение

Positional encoding или как нейросеть «читает» текст

Большинство нейросетей работают с числами и читать как человек они не умеют, поэтому инженерами были придуманы способы помочь нейросети уловить не только смысл конкретного слова, но и всего предложения. Для достижения такой цели используется positional encoding, то есть помимо отдельных слов нейросети дают их порядок в тексте. В данной статье приведен сравнительный анализ чисто смысловых векторов, линейного базиса (порядковый номер слова), базиса Фурье (синусы и косинусы), комплексного (экспоненты) и полиномы Чебышева для кодирования двух английских фраз.

продолжить чтение

Квантизация LLM: как запихнуть 70B модель в свою видюху

Ну что, думаете что для запуска LLaMA 3 70B вам нужна серверная стойка за лярд рублей? Поздравляю, вас обманули маркетологи GPU-вендоров. Модели с сотнями миллиардов параметров — LLaMA 3 70B, DeepSeek-V3 с его 671 лярдом параметров — жрут vRAM как не в себя, но есть способ запихнуть это все в обычную потребительскую видюху.Сегодня в статье разберем, как работает чудо квантизации под капотом, чем отличаются PTQ и QAT, почему MoE-модели (DeepSeek-V3, Mixtral, LLaMA 4 Scout) квантизовать сложнее и как выбрать между GPTQ, GGUF и AWQ.

продолжить чтение

123456...8