Google обновила Android Bench — бенчмарк для оценки LLM в задачах Android-разработки
Google обновила Android Bench — бенчмарк для оценки LLM в задачах Android-разработки. Инженеры компании полностью переработали методологию тестирования, добавили новые модели и предоставили возможность разработчикам участвовать в развитии набора тестов.
QuantCode-Bench: умеют ли LLM генерировать исполняемые алгоритмические торговые стратегии
Большие языковые модели уже показывают высокие результаты в задачах программирования общего назначения. Они умеют генерировать код, исправлять ошибки, работать с существующими репозиториями и решать задачи, для которых ещё несколько лет назад требовалось непосредственное участие разработчика.Однако в прикладных областях одной синтаксической корректности недостаточно. Модель должна не только написать валидный код, но и правильно интерпретировать предметную постановку, использовать специализированный API и обеспечить требуемое поведение программы при исполнении.
Гендиректор Microsoft: не выдавайте ИИ-компаниям свои секреты
Генеральный директор Microsoft Сатья Наделла предостерёг компании, спешащие внедрить искусственный интеллект, от передачи разработчикам ИИ важных бизнес-данных.
LLM и уровень усилий (effort) в Claude Code: знать больше или стараться лучше?
Claude Code даёт две настройки, которые обе как бы «улучшают ответ»: модель и уровень усилий (effort). Но как они влияют на результат? И как понять, когда нужно менять модель, а когда — просто уровень усилий?Легко предположить, что модель побольше, например Fable, даёт результат лучше, чем Sonnet, а более высокий уровень усилий значит просто «Claude думает дольше перед ответом».Первое предположение верно. Наши крупнейшие модели действительно более способные согласно отраслевым бенчмаркам.
Метод атаки Ghostcommit скрывает подсказки в изображениях для кражи секретов у ИИ-агентов
Исследователи разработали метод атаки Ghostcommit через pull request, позволяющий похитить секретные данные репозитория. Вредоносная инструкция скрывается внутри PNG-изображения, которое ИИ-инструменты для проверки кода обычно не открывают.
Выбираем лучшую нейросеть для видео 2026
Привет Хабр!В прошлых годах видео от нейросети было заметна по характерным огрехам. По плывущим лицам, лишним пальцам и кривому движению. Как дела обстоят в середине 2026-го? Мы взяли пять топовых генераторов видео — Veo 3.1, Kling v3 Omni, Sora 2 Pro, LTX-2.3 Pro и Grok Imagine Video 1.5 — и прогнали их через 7 одинаковых сценариев. Одинаковые промпты, одинаковые настройки, равные условия. От средневекового рыцаря до жонглёра, кота-паникёра и Уилла Смита, жадно уминающего спагетти. МоделиВ соревновании участвуют:Veo 3.1 (Google)Kling v3 Omni VideoSora 2 Pro (OpenAI)
Четыре истории внедрения ИИ в бизнесе: агент для заявок, RAG по документам и проверка сметы нейросетями
«Внедрить ИИ» — формулировка, за которой на практике скрываются совершенно разные по масштабу работы. Одной компании нужен агент, который годами живёт на сервере и разбирает входящие заявки. Другой — разовый прогон одного документа через связку нейросетей перед подписанием акта. Третьей автоматизация вообще ни к чему: важнее, чтобы команда сама умела ставить задачи агенту и проверять результат, без подрядчика на каждое изменение.
Mamba: архитектура, которая шла убивать трансформеры
В декабре 2023 по ML-тусовке прокатилась волна заголовков в духе «трансформерам конец». Поводом стала статья двух исследователей — Альберта Гу и Три Дао — со скучным названием:

