Машинное обучение. - страница 5

Галлюцинации недели: Джефф Дин уходит из Google, релиз Qwen 3.8 Max и агенты, которые завели себе доску объявлений

продолжить чтение

Топ вопросов с NLP собеседований: архитектуры LLM, инференс и оптимизация

На NLP/LLM собеседованиях все чаще проверяют не только знание трансформеров, но и понимание того, как устроены современные GPT-like модели: почему большинство генеративных LLM используют decoder-only архитектуру, чем LLaMA отличается от ванильного Transformer, зачем нужны RoPE, RMSNorm, SwiGLU и GQA. Почему инференс LLM дорогой и какие оптимизации помогают его ускорять.В этой статье - чеклист по архитектурам LLM и оптимизации инференса с картинками и схемами. Это не полноценная лекция с нуля, а тренажёр перед техническим интервью: пройтись по ключевым определениям, увидеть типовые вопросы и закрыть пробелы в формулировках.Содержание:

продолжить чтение

Tencent представила WorldClaw — систему AI‑агентов для генерации редактируемых 3D‑миров по текстовому описанию

Исследователи Tencent представили WorldClaw — экспериментальную систему AI‑агентов, которая по текстовым запросам собирает 3D‑сцены с рельефом, отдельными регионами, растительностью, зданиями и другими объектами. Содержимое сцены при этом можно редактировать.

продолжить чтение

Экс‑директор по кибербезопасности США: «Азимов был прав» насчёт правил для ИИ

Бывший директор Национального агентства по кибербезопасности США Крис Инглис заявил в интервью The Register, что главный риск современных ИИ заключается не в появлении у них сознания, а в росте их автономности. Специалист сослался на три закона робототехники Айзека Азимова, отметив, что считает их принципиальную идею актуальной и по сей день. 

продолжить чтение

Диффузионные языковые модели: как устроены, что в них работает, а что вызывает вопросы

Привет, Хабр. На связи команды «Интерпретируемый ИИ» и «Основы генеративного ИИ» AIRI и «Генеративная поэзия» SberAI. Мы занимаемся альтернативными архитектурами языковых моделей — тем, что могло бы работать вместо привычной генерации токен за токеном слева направо.Одно из таких направлений — диффузионные языковые модели (dLLM). Диффузионные языковые модели, в отличие от обычных LLM, генерируют текст параллельно, несколько токенов за раз. Теоретически это даёт кратное ускорение. Также они не ограничены генерацией справа от контекста и могут заполнять произвольные пропуски в поданном на вход тексте.

продолжить чтение

Масштабирование LLM: от одного чипа до ЦОДа. Глава 4. Тренировка трансформера

Предыдущая главаНаконец-то мы добрались непосредственно до того, как тренировать трансформер, и не просто тренировать, а делать это эффективно и масштабируемо.

продолжить чтение

ИИ нашёл уязвимость на сайте спортзала и отменил чужую бронь ради хозяина-пользователя

Пользователь из Австралии по имени Эндрю попросил

продолжить чтение

11-летняя девочка обошла родительский контроль на ноутбуке с помощью Claude, попросив ИИ собрать ей отдельный браузер

продолжить чтение

Помешательство вокруг ИИ парализовало принятие решений

Об авторе: Ник Суреш — австралийский дата‑инженер родом из Малайзии. Отмучившись в паре крупных корпораций, он основал консалтинговую фирму, помогающую небольшим клиентам налаживать работу с данными.Я убеждён, что целые компании сейчас в состоянии ИИ‑психоза, с ними невозможно нормально общаться на тему ИИ. Не буду называть имена, потому что среди этих людей есть мои хорошие друзья, но мне страшно представить, чем всё это может для них закончиться.— Митчелл Хашимото, основатель HashiCorp

продолжить чтение

OpenAI замедлила разработку модели Astra

OpenAI сообщила о приостановке работы над некоторыми аспектами своей будущей модели Astra после того, как внутренняя проверка выявила значительные успехи в программировании агентов и кибербезопасности — достаточные для того, чтобы вызвать опасения по поводу её возможностей.

продолжить чтение

1...345678...2030...522