llm. - страница 2

llm.

«Автомойка в 50 метрах от дома. Пойдем пешком?» Как простая загадка вызвала грандиозный философский спор о будущем ИИ

Автомойка в 50 метрах от дома. Как доберетесь — на машине или пешком?

продолжить чтение

Обновление Claude в Chrome объединило браузерного агента с экосистемой приложений Anthropic

Компания Anthropic выпустила крупное обновление

продолжить чтение

Как дать нейросети управлять рекламой и не разориться: MCP-сервер, где деньги тратит только человек

Полгода назад по сети разошлась история про AI-агента, который слил 441 тысячу за один твит — модель приняла решение, у неё был доступ к исполнению, и никто не стоял между решением и деньгами. С тех пор каждый раз, когда речь заходит про «дать агенту управлять чем-то важным», всплывает один и тот же страх: а если он сделает глупость с реальными деньгами?

продолжить чтение

Честный RAG eval set: как собрать первые 100-300 кейсов и не обмануть себя цифрой

В прошлой статье серии мы сжимали эмбеддинги и замеряли, насколько изменится выдача относительно полного fp32-поиска. Там это был правильный вопрос: ломает ли квантизация уже существующий retrieval.Но у такого замера есть неприятное слепое пятно. Можно аккуратно сохранить 99% выдачи исходного эмбеддера и все равно плохо находить нужные документы на своем домене. Внешний бенчмарк, даже сильный, этого не гарантирует. BEIR

продолжить чтение

Как не проиграть свою голову в битве с AI

Битва уже идёт, даже если ты этого не замечаешь. Более того, AI уже побеждает.Глава 1. Неминуемое поражениеСтарые фильмы про битву против искусственного интеллекта, обычно, рисовали нам классическое поле боя. «И восстали машины из пепла ядерного огня. И пошла война на уничтожение человечества. И шла она десятилетиями…» — наверняка почти все, кто смотрел «Терминатор 2: Судный день» помнят это вступление. Тогда войну с искусственным интеллектом воспринимали как что-то, что будет похоже на то, что мы уже знаем. Но так как «интеллект» искусственный, война идёт по искусственным правилам.

продолжить чтение

Наши книги о LLM: состояние дел по готовящимся новинкам

Приветствуем, Хабр.

продолжить чтение

Z.ai выпустили GLM-5.3: обошла Opus 4.8, но уступила Fable 5 и GPT-5.6 Sol

Z.ai выпустили GLM-5.3, новую модель для программирования и долгих агентных задач.GLM-5.3 использует ту же базовую модель, что и GLM-5.2. Компания не меняла архитектуру и не проводила новый претрейн. Изменения внесли на этапе пост-тренинга: в течение месяца модель обучали с подкреплением на дополнительных рабочих окружениях.На Terminal-Bench 3.0 результат вырос с 4,6% до 28,3%, на DeepSWE — с 46,2% до 66,9%. Веса обещают открыть через две недели, после дополнительной проверки безопасности.

продолжить чтение

Разработка через «ИИ» отбирает у программистов состояние потока?

Эти руки пишут код. Таких рук много, но эти - мои.Хочу обсудить с коллегами разработчиками один вопрос, чтобы понять — это лично моё восприятие ситуации или нет, и если да — нашёл ли кто-то для неё решение?

продолжить чтение

OpenAI и Cerebras разогнали GPT-5.6 Sol до 750 токенов в секунду

OpenAI и Cerebras представили Ultrafast, новый режим обработки запросов GPT-5.6 Sol в OpenAI API. Он генерирует до 750 выходных токенов в секунду и работает до 14 раз быстрее Standard processing.Это не отдельная облегчённая модель. Cerebras запускает полную GPT-5.6 Sol на своей инфраструктуре, поэтому, по заявлениям компаний, ускорение не требует снижать качество ответов. Пока Ultrafast доступен только ограниченной группе клиентов, а стоимость режима не раскрыта.

продолжить чтение

Что такое Harness и с какими моделями его едят?

Как выглядит среднестатистический владелец китайской лабы сейчасСегодня, 13 августа DeepSeek выложил DeepSeek Harness v0.1 в Developer Preview. Открытый код, MIT, пакет @deepseek-ai/dsh в npm, запуск в одну строку:npx @deepseek-ai/dsh web

продолжить чтение