codex.

Встречаем GPT‑6 Sol и Luna

Эта статья — перевод оригинальной статьи «Introducing GPT‑6 Sol and Luna».Также я веду телеграм канал «Frontend по‑флотски», где рассказываю про интересные вещи из мира разработки интерфейсов и AI.ВступлениеВ начале этого месяца мы представили GPT-6 Astra — нашу самую интеллектуальную и выровненную модель. Для самых сложных и критически важных задач по-прежнему стоит использовать всю мощь Astra, но на практике задачи бывают разного масштаба, требуют разной скорости и укладываются в разные бюджеты.

продолжить чтение

Одна цифра в двух смыслах: читаю whitepaper Сбера про AI-Disrupt PDLC со своей телеметрией в руках

В мае Сбер выпустил whitepaper “AI-Disrupt PDLC” - документ о том, как перестраивать жизненный цикл разработки вокруг намерения человека. В сентябре Олег Бунин разобрал его на Хабре, отделив инженерную рамку от продуктовой витрины.Меня в этом документе зацепили числа про стоимость агентной работы, потому что у меня на диске лежит телеметрия: я веду всю работу агентными инструментами, и логи пишутся сами. Я скачал обе версии whitepaper - короткую и полную на 175 страниц - посчитал свой расход и сел сравнивать.Главное, что я нашел, относится к самому документу:

продолжить чтение

Бенчмарк Маракуйя ИИ на Terminal-Bench 4 и OSWorld 2

Всем привет!В прошлой статье я гонял Алису и Гигачат по сложным бенчмаркам как чаты: Arena-Hard, WildBench, MultiChallenge, τ³, ПРАКТ-120. Там модель должна была отвечать текстом в браузере - как будто она общалась с пользователем, а пользователь задавал разные задания. Те тесты определяли, справляется ли модель именно как чат-агент.

продолжить чтение

Что, опять сетевики не нужны? И немного про SRv6

Факт 1. Недавно у меня было простое желание - написать заметочку про SRv6, вернее даже не про SRv6 как таковой, а про то как индустрия пришла от простого LDP к каким-то там SRv6 Дисклеймер №1Прежде чем читать эту статью дальше - откройте ссылку https://blog.pomazanov.com/posts/srh-vs-two-labels/ - пролистайте её, не особо вдаваясь в детали, минут пять займёт. Это для ознакомления с сутью того, что хотелось получить по факту факта 1. Факт 2. Листая на днях ленту Linkedin, знаменитой ярмарке тщеславия, заметил что у каждого второго чувака в ленте теперь есть модная AI-приставка к его роли:

продолжить чтение

История одного аккаунта OpenAI: паровозик, который не смог

TLDR: забанили трёхлетний аккаунт с подпиской Pro, кибер‑доступом Daybreak Blue и вследствии: доступ ко всей накопленной информации в аккаунте — утерян.Салют! Много‑много лет читаю Хабр, но сейчас специально зарегистрировался, чтобы рассказать маленькую историю, которая возможно поможет клиентам OpenAI избежать моей участи.Приступим.Жил да был аккаунт OpenAI с 2023 года. Сначала, он был бесплатный, совсем маленький. Потом подрос и пошёл в школу с ежемесячной оплатой в $20. К 2026 году аккаунт совсем возмужал и обросся подпиской Pro за $100 в месяц. Не тужил, от слова.Аккаунт был любознательный

продолжить чтение

Разработчик Codex: запуск большого количества ИИ‑агентов только увеличивает расход токенов

Разработчик OpenAI Codex Эрик Провенчер поделился своим наблюдением: по его словам, параллельный запуск большого количества ИИ‑агентов часто лишь резко увеличивает расход токенов, но не улучшает результат.

продолжить чтение

Как проверяющий ИИ испортил правильные ответы: разбор генератора учебных заданий

В задании на сортировку было слово «маши…ый». Генератор положил его в корзину «Две НН», и это верно. Проверка переложила слово в корзину «Одна Н». Вот ответ модели-арбитра, после которого это случилось, без правок, из сохранённого JSON:{ "n": 4, "a": "Одна Н", "why": "Прилагательное от «машина» с суффиксом -н-: корень оканчивается на н? Нет — «машин-» + -н- даёт «машинный»? В школьной норме пишется «машинный» (две НН), но по данному заданию основа «машин»+н… — фактически верно «машинный»." } Ответ в поле a неверный, а в объяснении модель сама приходит к «машинный». Код читал только a.

продолжить чтение

Сколько стоит месяц с AI-агентом: API против подписок

В августе 2026 я показывал своим коллегам на митапе таблицу с месячной стоимостью работы через разные модели. Через месяц открыл её снова — половина цифр уже устарела. DeepSeek ввёл пиковые тарифы, Z.ai перевёл GLM Coding Plan на кредиты, появились новые модели. Пришлось пересчитать всё заново по ценам на 16 сентября и заодно разобраться, что выгоднее: платить за API или покупать подписки.Что я считал

продолжить чтение

Одиннадцать релизов за сутки: как мы чинили память ИИ-агента и что из этого вышло

Неделю назад я выложил skillmem — локальную память процедур для кодовых агентов. За прошедшие сутки вышло одиннадцать релизов: с 0.9.3 по 0.10.5. Не потому, что чесались руки, а потому что я сел проверять собственный продукт и нашёл в нём подряд одиннадцать вещей, которые надо было починить. Это пост про то, что именно, — почти каждый пункт переносится на любой инструмент, который живёт внутри цикла агента.Начало: 4083 сессии за суткиНачалось с безобидного вопроса: а всё ли у нас работает. Полез в лог хуков и увидел, что Stop-хук за день сработал 4083 раза

продолжить чтение

GPT-6 Astra вышла. Я стал ещё внимательнее смотреть, что ей поручаю

Недавно OpenAI выпустила GPT-6 Astra. Новая модель стала лучше работать с длинными и сложными задачами, большим контекстом, файлами и инструментами. Для меня это интересный релиз ещё и потому, что AI я в основном использую не для написания кода. Я PM, поэтому мои основные задачи это требования, Jira, документы, анализ информации, планирование и подготовка материалов.За последний год мой подход к AI довольно сильно поменялся. Сначала ChatGPT был для меня улучшенным поиском: дай мне информацию, а дальше я сам её обработаю.

продолжить чтение

123456...10...15