llm. - страница 119

llm.

1C Code Bench — спустя 5 месяцев

Бенчмарк разработан в Управлении экспериментальных систем машинного обучения Sber Al. Мы учим собственные модели, активно продвигаем науку в области, ставим уникальные эксперименты, пишем статьи уровня А* и создаем собственные бенчмарки. 1C Code Bench создан командой GigaCode R&D и командой разметки УЭСМО.

продолжить чтение

От GTD к AI-агенту: как я собрал локальный второй мозг на Codex, Markdown и Obsidian

Я не программист: когда-то давно я учил веб-разработку, понимаю базовые вещи про HTML, CSS, JavaScript, файлы, папки и GitHub, но профессионально разработкой не занимаюсь.При этом потребность систематизировать знания и дела у меня была давно.Личные заметки, рабочие задачи, бизнес-проекты, документы, идеи, планы, договорённости — на первый взгляд это разные вещи. Но на более глубоком уровне почти всё сводится к одному циклу:получить информацию;понять, что в ней важно;сохранить её так, чтобы потом найти;связать с уже известным;применить в нужный момент.

продолжить чтение

Почему RAG — это не просто «добавить поиск»: latency, качество и выбор стратегии retrieval

Главное: RAG — это не просто «поиск + LLM». В локальном эксперименте основная дополнительная нагрузка появилась не в vector DB, а в embedding запроса, росте размера prompt и его обработке моделью. Top-k, chunk size и retrieval mode оказались параметрами проектирования и контроля, а не техническими настройками «по умолчанию». Главный вывод: стратегию retrieval нужно выбирать под тип вопроса, структуру данных, latency budget и требований к качеству.Введение

продолжить чтение

echo hello-world | ai

Опубликован прототип ai-cli — консольная утилита на Rust для встраивания LLM (GitHub Models, OpenAI, Groq, DeepSeek и др.) в pipeline командной строки. Проект распространяется под лицензией MIT. Документация и исходники доступны на github.Утилита принимает запрос из аргументов или stdin, отправляет его в выбранную LLM, а полученный ответ (команду, сообщение, данные) направляет в терминал, файл, клипборд или stdout. Главное отличие от аналогов — ai-cli не является агентом, никогда не выполняет команды автоматически: утилита печатает их терминале (эмуляция ввода с клавиатуры), вы редактируете и сами нажимаете Enter для запуска.

продолжить чтение

Anthropic выпустили Opus 4.8: в 4 раза меньше незамеченных багов и fast mode в 3 раза дешевле

Anthropic выпустили Claude Opus 4.8 — обновление флагманской модели, доступное с сегодняшнего дня по той же цене: $5 за млн входящих токенов и $25 за млн исходящих.

продолжить чтение

Cerebras ускорила 1 трлн модель kimi K2.6 до тысяча т-sec

Недавно компания производитель чипов Cerebras добавила топовую открытую трилионную модель Kimi k2.6, на свою платформу.

продолжить чтение

Gemini-3.5-flash догнал GPT-5.5 на 97-S и в 2.5× дешевле. Но главное — китайцы выигрывают по цене и качеству

Главная новость месяца — китайцы перестали быть «дешёвой альтернативой» и стали реальным конкурентом США по соотношению цена/качество. По чистому качеству американцы пока впереди, но по соотношению цена/качество (которое учитывает оба фактора) лидируют китайские модели. Это сдвиг рынка, а не «ещё один релиз».Gemini-3.5-flash догнал OpenAI — 97/S, тот же балл, что у GPT-5.5, при этом в 2.5 раза дешевле ($0.09 против $0.23 за вызов). Google впервые на нашем тесте берёт ту же вершину, что OpenAI на длинном русском контенте.DeepSeek V4 Flash

продолжить чтение

Как команда становится AI Native: методология из 4 этапов

Подписки купили, тренинг провели, через два месяца все вернулись в Excel. Знакомо? Делюсь методологией, через которую мы прошли в Alpina Digital и которую повторили у 40+ корпоративных клиентов.Жемал Хамидун, Head of AI Alpina Digital, CPO AlpinaGPT

продолжить чтение

Анатомия Claude Code. Первичный анализ и наполнение контекста

Каждый, кто программирует с агентами (Claude Code, Codex и т.д.), знает: перед тем как приступить к задаче, агент исследует проект. Это кажется логичным, естественным и закономерным, ведь люди делают так же. Обычно говорят: «агент наполняет контекст».Для агента такой контекст должен содержать не только полезные сведения, но и не включать лишних, которые могут оказать влияние на конечный результат. Но добиться этого не так-то просто, поскольку:задача определена в общем виде (кто знает, что имел в виду автор)пути исследования не детерминированы (в общем виде не используется специфика фреймворка)

продолжить чтение

SaaS умирает? Я сравнил 8 публикаций Q1 2026 с тем, что вижу внутри Kaiten

Последние месяцы я вижу одну и ту же мысль: SaaS умирает, AI-агенты забирают работу из интерфейсов, а компании перестают платить за пользовательские лицензии. На первый взгляд кажется, что так и есть.  Если агент может сам прочитать CRM, создать задачу, разобрать заявку, сходить в API и принести руководителю готовый статус, зачем держать десятки людей в системе? Пусть машина сама делает работу, а человек только проверяет. 

продолжить чтение