Великий парадокс VRAM: почему мы платим миллионы за память, чтобы делать всё, лишь бы ей не пользоваться
Если вы посмотрите на эволюцию видеокарт для машинного обучения, вы увидите одну тенденцию: гонку за объемом видеопамяти. Размеры LLM пухнут, KV кэш сжирает терабайты, батчи становятся всё больше. Нам нужно больше VRAM. Еще больше VRAM.Но если вы когда-нибудь писали собственные ядра на triton, вы знаете одну жестокую тайну, о которой не задумываются дата саентисты высокоуровневых фреймворков.Самая дорогая часть вашей видеокарты это самое медленное, узкое и отвратительное место во всей системе. И вся современная ML оптимизация (Kernel Fusion, FlashAttention, PagedAttention) сводится к одному правилу:
Pollux: LLM-as-a-judge для русского
Прошло несколько лет с тех пор, как нейросетевые модели стали применимы в генерации текста. Сегодня языковые модели уверенно решают задачи написания кода, поддержки диалогов и планирования маршрутов. Тем не менее, до сих пор не сложилось универсального подхода для валидации LLM перед их внедрением в цифровые продукты.
Почему 4 сеньёра могут быть эффективнее команды из 15 человек
Есть компании, которые верят в то, что уж лучше много джунов за копейки, чем несколько сеньоров за дорого.Очевидно, мнения могут быть разными, поэтому поделюсь своим опытом: 1. В компании Х у нас было 4 человека, которые ещё до эпохи ChatGPT с нуля за несколько месяцев собрали полноценный AI-стек: — fine-tune собственных LLM на своих датасетах — свой TTS/STT на своих датасетах — генерацию лиц и deepfake — MLOps-инфраструктуру и пайплайны
ИИ не разгружает сотрудников. Он просто повышает планку ожиданий
Если вы используете GPT в работе, вы уже могли поймать странный эффект: задачи стали делаться быстрее, но свободнее не стало. Более того — иногда кажется, что стало тяжелее.Раньше ты писал отчёт два часа. Теперь собираешь его за двадцать минут. Но вместо того чтобы получить обратно эти полтора часа, ты начинаешь делать отчёт глубже: добавляешь аналитику, проверяешь гипотезы, готовишь несколько сценариев, аккуратнее формулируешь выводы.И в какой-то момент возникает неприятный вопрос: если ИИ действительно экономит мне время, почему я не чувствую себя менее загруженной?
Функции Gemini Intelligence для Android-смартфонов будут поддерживаться лишь ограниченным числом премиальных устройств
Google представила набор функций на базе искусственного интеллекта Gemini Intelligence, но он будет доступен лишь на ограниченном числе Android-смартфонов премиального сегмента.
Мишустин поручил обеспечить госспрос на российские ИИ-модели
Премьер‑министр Михаил Мишустин поручил Минцифры и Минпромторгу проработать возможности создания механизма гарантированного спроса на отечественные языковые модели. Речь идёт о собственных решениях «Сбера» GigaChat и «Яндекса» Alice AI LLM.По словам Мишустина, для этого может потребоваться внести изменения в законодательство в два закона — 44-ФЗ (определяет порядок закупок для государственных и муниципальных учреждений) и 223-ФЗ (определяет порядок закупок для компаний с госучастием), уточнил он.
Алиса AI научилась лучше генерировать изображения с русскоязычным текстом
Пресс-служба «Яндекса» рассказала Хабру про обновление модели для генерации изображений Alice AI ART. Нейросеть теперь точнее работает с русскоязычными текстами на картинках. Благодаря этому пользователи могут создавать изображения с более длинными и корректными текстами на русском языке.
Агент — это не новый пользователь. Это новый посредник. Что медицина знает об этом 100 лет
На этой неделе прочитала свежую статью Кьяры Пеллегрини из NN/g: «AI-агенты теперь тоже пользователи наших интерфейсов». Автор — серьёзный исследователь, статья хорошо аргументирована. У агента есть цели, агент сталкивается с интерфейсом, агент пытается достичь целей через наш дизайн. По функциональному определению — пользователь.Я не согласна с этой рамкой. И думаю, что разница принципиальная.
