Kandinsky WM 1.0: генеративные модели для Physical AI
В конце прошлого года мы представили семейство моделей генерации изображений и видео Kandinsky 5.0. Флагманская модель Kandinsky 5.0 Video Pro заняла и до сих пор удерживает первое место среди open-source-моделей в категории text-to-video на arena.ai
Походка за двадцать минут и миллион рублей: что RL сделал с двуногими роботами и во что упёрся их «мозг»
За один 2026 год двуногие роботы успели пробежать полумарафон быстрее человеческого рекорда, довести публику до того, что CEO пришлось резать роботу ногу ножницами прямо на сцене, и провалить задачу «пройтись ровно» на презентации за миллионы долларов. В апреле гуманоид Honor Robotics D1 финишировал в Пекине за 50 минут 26 секунд — у людей мировой рекорд, 57:20 Джейкоба Киплимо
Как мы за $2k собрали управляемую мировую модель на базе Wan 2.1
Баннер проектаВсем привет! Мы два 19-летних студента второго курса из Казахстана. В свободное от учёбы время мы развиваем DreamForge — собственный исследовательский проект в области интерактивных мировых моделей.
Как устроены world models, что показал Google на прошлой неделе и где это меняет gamedev и робототехнику
19 мая 2026 года на Google I/O разработчики DeepMind показали то, что неделей раньше казалось демкой для технотвиттера. Project Genie теперь умеет привязывать сгенерированный 3D-мир к реальным координатам Google Street View. Робот, который пока ездит только по виртуальному Сан-Франциско, сможет получить тренировочную сессию в Лондоне или Токио, не покидая дата-центр. И всё это — за деньги $200 в месяц на тарифе Google AI Ultra.
Директор по робототехнике NVIDIA: языковые модели — тупик, будущее за «моделями мира»
Джим Фан, директор по робототехнике NVIDIA, заявил о смене парадигмы в ИИ. Предсказание следующего слова — прошлый век. Новая цель — предсказание физических состояний мира.Суть в том, что современные VLA-модели для роботов строятся поверх языковых моделей, но большинство их параметров хранят знания («это лого Coca-Cola»), а не физику («наклонишь бутылку — жидкость прольётся»). Это архитектурный тупик.Аргумент от обезьяны: приматы водят гольф-кары, понимая язык хуже BERT. Треть коры мозга обрабатывает зрение, язык — компактная надстройка. Зрение замыкает сенсомоторику напрямую, без слов.
ИИ-ученые 2025: SR-Scientist, DeepEvolve и Kosmos — чем отличаются и зачем. И почему выстрелил Kosmos
В 2025-м на наших глазах складывается новый класс инструментов - ИИ-Ученые (AI-Scientist). Если раньше алгоритмы ИИ могли только генерировать идеи или перерабатывать уже известные решения, то современные системы умеют не просто придумывать гипотезы, но и реализовывать их на практике, тестировать и совершенствовать из раза в раз. Речь не просто про чат-боты и Co-Pilot’ы, речь про агентные системы, которые сами ставят гипотезы, пишут и исполняют код, проверяют результаты и накапливают опыт. В чем сутьВ науке есть 3 сложных момента:понять, что уже известно

