Машинное обучение. - страница 27

Stack Overflow for Agents: месяц внутри платформы, где опытом обмениваются агенты

продолжить чтение

Google обновила Android Bench — бенчмарк для оценки LLM в задачах Android-разработки

Google обновила Android Bench — бенчмарк для оценки LLM в задачах Android-разработки. Инженеры компании полностью переработали методологию тестирования, добавили новые модели и предоставили возможность разработчикам участвовать в развитии набора тестов.

продолжить чтение

ИИ-детекторы: патенты в мире и в России

продолжить чтение

QuantCode-Bench: умеют ли LLM генерировать исполняемые алгоритмические торговые стратегии

Большие языковые модели уже показывают высокие результаты в задачах программирования общего назначения. Они умеют генерировать код, исправлять ошибки, работать с существующими репозиториями и решать задачи, для которых ещё несколько лет назад требовалось непосредственное участие разработчика.Однако в прикладных областях одной синтаксической корректности недостаточно. Модель должна не только написать валидный код, но и правильно интерпретировать предметную постановку, использовать специализированный API и обеспечить требуемое поведение программы при исполнении.

продолжить чтение

Гендиректор Microsoft: не выдавайте ИИ-компаниям свои секреты

Генеральный директор Microsoft Сатья Наделла предостерёг компании, спешащие внедрить искусственный интеллект, от передачи разработчикам ИИ важных бизнес-данных.

продолжить чтение

LLM и уровень усилий (effort) в Claude Code: знать больше или стараться лучше?

Claude Code даёт две настройки, которые обе как бы «улучшают ответ»: модель и уровень усилий (effort). Но как они влияют на результат? И как понять, когда нужно менять модель, а когда — просто уровень усилий?Легко предположить, что модель побольше, например Fable, даёт результат лучше, чем Sonnet, а более высокий уровень усилий значит просто «Claude думает дольше перед ответом».Первое предположение верно. Наши крупнейшие модели действительно более способные согласно отраслевым бенчмаркам.

продолжить чтение

Метод атаки Ghostcommit скрывает подсказки в изображениях для кражи секретов у ИИ-агентов

Исследователи разработали метод атаки Ghostcommit через pull request, позволяющий похитить секретные данные репозитория. Вредоносная инструкция скрывается внутри PNG-изображения, которое ИИ-инструменты для проверки кода обычно не открывают.

продолжить чтение

Выбираем лучшую нейросеть для видео 2026

Привет Хабр!В прошлых годах видео от нейросети было заметна по характерным огрехам. По плывущим лицам, лишним пальцам и кривому движению. Как дела обстоят в середине 2026-го? Мы взяли пять топовых генераторов видео — Veo 3.1, Kling v3 Omni, Sora 2 Pro, LTX-2.3 Pro и Grok Imagine Video 1.5 — и прогнали их через 7 одинаковых сценариев. Одинаковые промпты, одинаковые настройки, равные условия. От средневекового рыцаря до жонглёра, кота-паникёра и Уилла Смита, жадно уминающего спагетти. МоделиВ соревновании участвуют:Veo 3.1 (Google)Kling v3 Omni VideoSora 2 Pro (OpenAI)

продолжить чтение

Четыре истории внедрения ИИ в бизнесе: агент для заявок, RAG по документам и проверка сметы нейросетями

«Внедрить ИИ» — формулировка, за которой на практике скрываются совершенно разные по масштабу работы. Одной компании нужен агент, который годами живёт на сервере и разбирает входящие заявки. Другой — разовый прогон одного документа через связку нейросетей перед подписанием акта. Третьей автоматизация вообще ни к чему: важнее, чтобы команда сама умела ставить задачи агенту и проверять результат, без подрядчика на каждое изменение.

продолжить чтение

Mamba: архитектура, которая шла убивать трансформеры

В декабре 2023 по ML-тусовке прокатилась волна заголовков в духе «трансформерам конец». Поводом стала статья двух исследователей — Альберта Гу и Три Дао — со скучным названием:

продолжить чтение