deepseek. - страница 41

DeepSeek-R1 для чайников

В последние месяцы всё чаще слышим про «reasoning-модели», способные не просто продолжать текст, а действительно шаг за шагом решать сложнейшие задачи цепочкой рассуждений (chain-of-thought). Впервые такой подход эффектно показали в OpenAI o1, но, к сожалению, подробности там остаются секретными. Недавно же команда DeepSeek наделала шуму с открытыми вариантами R1 и R1-Zero, созданными поверх их собственной большой MoE-модели DeepSeek-V3. В этом посте я не стану углубляться в вопрос «чья модель лучше — o1 или R1». Зато разберу, какие главные технические детали

продолжить чтение

Все встревожены взлетом DeepSeek — кроме Nvidia, которая этому способствовала

Акции Nvidia просели в цене, а регуляторы ограничивают её продажи чипов, но американский гигант ИИ смотрит в будущее и ведёт долгую игру в Китае.Дисклеймер: это вольный перевод лонгрида

продолжить чтение

Глава OpenAI Сэм Альтман не намерен подавать иск против создателей китайского чат-бота DeepSeek

Генеральный директор американской технологической компании OpenAI Сэм Альтман не намерен подавать иск против создателей китайского чат‑бота DeepSeek

продолжить чтение

Восстание DeepSeek: что не попало в заголовки новостей

Недавние публикации об ИИ-моделях компании DeepSeek посвящены, в основном, двум моментам. Первый —  эти модели гораздо лучше, чем другие, показывают себя в тестах. Второй — они обходят другие модели в плане эффективности работы. Эти достижения достойны внимания, они несут определённые политические последствия (ниже мы поговорим об этом подробнее). Но дело в том, что реальная картина, включающая в себя и доступ к вычислительным ресурсам, и экспортные ограничения, и разработки в сфере ИИ, гораздо сложнее, чем это представлено во многих материалах. Вот несколько важных вопросов, которые заслуживают более пристального внимания.

продолжить чтение

Поднимаем DeepSeek llm локально

Все уже слышали про новую модель DeepSeek r1, которая обогнала по бенчмаркам openai. Компания DeepSeek выложила веса и дистилляты в открытый доступ, поэтому мы можем их запустить.В статье поднимем дистилляты модели r1 используя llama.cpp - потребуются лишь базовые умения работы с bash, docker и python. Самостоятельный запуск проще простого.Что имеем?Основная модель, о которой говорят, DeepSeek r1 - 671b Mixture of Experts (37B активаций на forward). Целиком пытаться инференсить такую модель очень затратно.Если очень хочется r1, но не полную - есть квантизации от unsloth.

продолжить чтение

Модель DeepSeek R-1 добавили в инструмент для программистов Cursor AI

DeepSeek R-1 теперь поддерживается в Cursor AIКак разработчик, использующий искусственный интеллект в своих личных проектах в течение последнего года, я не могу не радоваться тому, что модель DeepSeek R-1 теперь доступна в Cursor AI.О поддержке новой модели компания DeepSeek объявила 

продолжить чтение

Регулятор в Японии призвал чиновников отказаться от DeepSeek

В министерстве цифровизации Японии призвали сотрудников всех министерств и ведомств воздержаться от использования нейросети DeepSeek. Китайский чат‑бот вызывает опасения у регулятора из‑за отсутствия открытой информации о возможном сборе персональных данных.

продолжить чтение

DeepSeek перестал загружать pdf и картинки

Да, я понимаю, что за эту неделю новости про DeepSeek всем уже надоели. Но для меня за последние 1,5 месяца эта платформа стала мощным рабочим инструментом (и вовсе не в генерации дурацких статей, а в извлечении информации из плохо отсканированных документов!) Итак...Одной из роскошных возможностей DeepSeek была возможность сфотографировать несколько листов нужной тебе книги в специальном приложении для смартфона, сохранить их в pdf и попросить DeepSeek вытащить нужную тебе информацию (он распознавал, OCR-ил текст!).То же самое с плохо отсканированным форматом djvu (предварительно сконвертированным в pdf).

продолжить чтение

Сравнение кода DeepSeek и ChatGPT(Golang)

Весь этот шум заставил меня заинтресоваться DeepSeek. Самое банальное сравнить с ChatGPT. Ну и плюсом, у меня сегодня выходной, можно и поиграть немного. Код пусть будет на Go. Модели GPT-o1 и Deepseek-R1. Заданием для нейронок будет написать две игры. Эти две игры это вообще первое что я когда либо написал в своей жизни, правда, это было не на Go. Задание 1: Игра "Пинг-Понг" на GoПромт:

продолжить чтение

HAI LLM: Как DeepSeek снизил стоимость обучения и генерации в разы без потери качества?

Работу у AI отобрал другой AI )Компания HighFlyer внедрила в свою LLM такие архитектурные фишки как Multi-Head Latent Attention, Mixture of Experts (MoE) with Auxiliary-Loss-Free Load Balancing и Multi-Token Predict. Однако все эти новшества уже были ранее представлены в других LLM: GPT-4, Llama, Mistrall и других.Полистав

продолжить чтение