llm.
1C Code Bench — спустя 5 месяцев
Бенчмарк разработан в Управлении экспериментальных систем машинного обучения Sber Al. Мы учим собственные модели, активно продвигаем науку в области, ставим уникальные эксперименты, пишем статьи уровня А* и создаем собственные бенчмарки. 1C Code Bench создан командой GigaCode R&D и командой разметки УЭСМО.
От GTD к AI-агенту: как я собрал локальный второй мозг на Codex, Markdown и Obsidian
Я не программист: когда-то давно я учил веб-разработку, понимаю базовые вещи про HTML, CSS, JavaScript, файлы, папки и GitHub, но профессионально разработкой не занимаюсь.При этом потребность систематизировать знания и дела у меня была давно.Личные заметки, рабочие задачи, бизнес-проекты, документы, идеи, планы, договорённости — на первый взгляд это разные вещи. Но на более глубоком уровне почти всё сводится к одному циклу:получить информацию;понять, что в ней важно;сохранить её так, чтобы потом найти;связать с уже известным;применить в нужный момент.
echo hello-world | ai
Опубликован прототип ai-cli — консольная утилита на Rust для встраивания LLM (GitHub Models, OpenAI, Groq, DeepSeek и др.) в pipeline командной строки. Проект распространяется под лицензией MIT. Документация и исходники доступны на github.Утилита принимает запрос из аргументов или stdin, отправляет его в выбранную LLM, а полученный ответ (команду, сообщение, данные) направляет в терминал, файл, клипборд или stdout. Главное отличие от аналогов — ai-cli не является агентом, никогда не выполняет команды автоматически: утилита печатает их терминале (эмуляция ввода с клавиатуры), вы редактируете и сами нажимаете Enter для запуска.
Anthropic выпустили Opus 4.8: в 4 раза меньше незамеченных багов и fast mode в 3 раза дешевле
Anthropic выпустили Claude Opus 4.8 — обновление флагманской модели, доступное с сегодняшнего дня по той же цене: $5 за млн входящих токенов и $25 за млн исходящих.
Cerebras ускорила 1 трлн модель kimi K2.6 до тысяча т-sec
Недавно компания производитель чипов Cerebras добавила топовую открытую трилионную модель Kimi k2.6, на свою платформу.
Gemini-3.5-flash догнал GPT-5.5 на 97-S и в 2.5× дешевле. Но главное — китайцы выигрывают по цене и качеству
Главная новость месяца — китайцы перестали быть «дешёвой альтернативой» и стали реальным конкурентом США по соотношению цена/качество. По чистому качеству американцы пока впереди, но по соотношению цена/качество (которое учитывает оба фактора) лидируют китайские модели. Это сдвиг рынка, а не «ещё один релиз».Gemini-3.5-flash догнал OpenAI — 97/S, тот же балл, что у GPT-5.5, при этом в 2.5 раза дешевле ($0.09 против $0.23 за вызов). Google впервые на нашем тесте берёт ту же вершину, что OpenAI на длинном русском контенте.DeepSeek V4 Flash
Как команда становится AI Native: методология из 4 этапов
Подписки купили, тренинг провели, через два месяца все вернулись в Excel. Знакомо? Делюсь методологией, через которую мы прошли в Alpina Digital и которую повторили у 40+ корпоративных клиентов.Жемал Хамидун, Head of AI Alpina Digital, CPO AlpinaGPT
Анатомия Claude Code. Первичный анализ и наполнение контекста
Каждый, кто программирует с агентами (Claude Code, Codex и т.д.), знает: перед тем как приступить к задаче, агент исследует проект. Это кажется логичным, естественным и закономерным, ведь люди делают так же. Обычно говорят: «агент наполняет контекст».Для агента такой контекст должен содержать не только полезные сведения, но и не включать лишних, которые могут оказать влияние на конечный результат. Но добиться этого не так-то просто, поскольку:задача определена в общем виде (кто знает, что имел в виду автор)пути исследования не детерминированы (в общем виде не используется специфика фреймворка)
SaaS умирает? Я сравнил 8 публикаций Q1 2026 с тем, что вижу внутри Kaiten
Последние месяцы я вижу одну и ту же мысль: SaaS умирает, AI-агенты забирают работу из интерфейсов, а компании перестают платить за пользовательские лицензии. На первый взгляд кажется, что так и есть. Если агент может сам прочитать CRM, создать задачу, разобрать заявку, сходить в API и принести руководителю готовый статус, зачем держать десятки людей в системе? Пусть машина сама делает работу, а человек только проверяет.

