- BrainTools - https://www.braintools.ru -
За неделю команда бенчмарка Design Arena выпустила два разбора моделей, возглавивших ее дизайн-лидерборды: разбор GPT-5.6 Sol [1], флагмана OpenAI, и свежий разбор [2] Kimi K3 от китайской Moonshot AI. Исследователи заглянули внутрь генераций и рассуждений моделей и показали, как именно те научились “вкусу”. Выяснилось, что универсального рецепта нет: две модели пришли к хорошему дизайну противоположными путями, а третья — прошлый лидер GLM 5.2 — своим, третьим.
Design Arena — это слепые сравнения: люди получают два сайта, сгенерированных разными моделями по одному запросу, и голосуют за тот, что нравится больше. Из голосов складывается Elo-рейтинг. Именно такие арены в свое время и зафиксировали феномен “типичного ИИ-дизайна” — узнаваемый набор штампов, по которым сгенерированный сайт видно за секунду: фиолетово-синие градиенты, bento-сетки из скругленных карточек, гигантская типографика вместо большой заглавной картинки, сетка-подложка на фоне. У Design Arena для этого есть термин “design smells”, и еще три месяца назад ими страдала GPT-5.5.
После релиза GPT-5.6 Sol заняла первое место на арене Web Design (Non-Agentic) с Elo 1353 — на 18 позиций выше предшественницы GPT-5.5. Для OpenAI это первый выход на вершину дизайн-лидерборда, причем модель попутно задала два новых Парето-фронта: среди моделей с сопоставимым рейтингом нет ни столь же быстрых, ни столь же дешевых. Sol генерирует дизайны в 2,44 раза быстрее прошлого лидера GLM 5.2 и на 36% быстрее Claude Fable 5, а стоит $5/$30 за миллион токенов против $10/$50 у модели Anthropic.
Чтобы понять, что изменилось, исследователи взяли 1000 сайтов, сгенерированных Sol, превратили каждый в CLIP-эмбеддинг — числовой “отпечаток”, в котором похожие дизайны оказываются рядом, — и спроецировали все это в двумерное пространство алгоритмом UMAP. Получилась карта области, которую занимают генерации модели. И на этой карте обнаружились странные дыры: пустые зоны, окруженные генерациями со всех сторон. У других моделей таких дыр нет — их дизайн-пространства сплошные, вариативность в них задается только запросом пользователя.

Расшифровать дыры помогло наложение: исследователи поместили генерации GPT-5.5 и Sol в общее пространство эмбеддингов, раскрасив первые синим, вторые оранжевым. Почти всюду облака точек перекрываются — модели в целом рисуют похожие сайты. Но есть кластер, где оранжевых точек нет вовсе: сайты с фиолетовыми градиентами. Тот же эффект нашелся для bento-сеток, гигантской типографики и смещенных (offset) композиций. Вывод исследователей: Sol выучила ИИ-антипаттерны — сама форма дыр выдает, что модель знает эти области дизайн-пространства, — но отказывается генерировать их содержимое. Модель знает, как выглядит “типичный ИИ-дизайн”, и активно его подавляет.
Для контраста — GLM 5.2, которая решила ту же задачу иначе: она избегает антипаттернов, потому что, судя по всему, вообще их не выучила. Модель работает от набора удачных шаблонов, в которых штампов пока просто нет (в сети не так много сайтов, сделанных GLM-5.2), поэтому и дыр в ее пространстве не возникает. Подавление у Sol при этом работает не на все: конфетти появляется в 26,5% ее генераций — модель даже пишет собственные библиотеки конфетти, когда готовых нет под рукой. С графиками у Sol тоже не сложилось: реалистичные диаграммы через chart.js ей не даются.
Второй разбор — про Kimi K3, которая заняла первое место на single-shot Frontend Arena с Elo 1408, поднявшись на 10 позиций относительно Kimi K2.6. Это крупнейший скачок в истории линейки Moonshot, а на этой неделе модель взяла еще и первое место на арене 3D-дизайна с Elo 1450, опередив Claude Fable 5. Внимание [3] исследователей привлекла аномалия: на простых одношаговых фронтенд-задачах K3 тратит почти в 4 раза больше токенов размышлений, чем Kimi K2.7 Code. Команда полезла в цепочки рассуждений выяснять, о чем модель столько думает.
Оказалось, K3 симулирует внутри цепочки рассуждений работу полноценного ИИ-агента. Ее рассуждения многостадийны: планирование, принятие решений, затем проектирование отдельных компонентов сайта — с итерациями и “мысленным тестированием” вместо реальных тестов, которые были бы у агента в настоящем цикле. По подсчетам на выборке из 3000+ генераций, K3 пишет в рассуждениях в 10 раз больше кода, чем любая другая модель линейки Kimi, — токенов кода в ее размышлениях больше, чем собственно размышлений. Модель думает таким образом: выражает план в виде конкретного кода и ограничений, а не расплывчатого наброска, сознательно разменивая скорость и токены на качество результата.

У этой стратегии нашелся неожиданный козырь — выученный “индекс интернета”. Чтобы понять трюк, нужно знать, как картинки вообще попадают на сгенерированные сайты: модель их не рисует, а вставляет в код ссылку на чужое фото, обычно с бесплатного фотостока Unsplash. Такая ссылка содержит длинный ID конкретного снимка — и чтобы вместо картинки на сайте не красовался серый квадрат, ID должен указывать на реально существующее и подходящее по смыслу фото. Агент с инструментами просто нашел бы его поиском, но на одношаговой арене поиска нет, поэтому модели обычно либо вписывают ID наугад и получают битую картинку, либо сразу ставят заглушку.
K3 идет третьим путем: она вспоминает ID наизусть. За время обучения [4] модель видела столько интернета, что связки вида “этот ID — фото заката над горами” записаны прямо в ее весах. В рассуждениях это разворачивается в плотный цикл “предложил — перепроверил”: модель решает, какая картинка ей нужна, с ходу выдает ID, а затем сама же оценивает, помнит ли она такой снимок и подходит ли он по смыслу — и если сомневается, пробует другой. Настоящей проверки тут нет: сходить по ссылке модель не может и сверяется с собственной памятью [5] — как человек, который проговаривает набранный по памяти номер телефона, прежде чем позвонить. Но память K3 на интернет оказалась настолько хорошей, что в разобранных примерах у нее не нашлось ни одной битой или нерелевантной картинки, тогда как Claude Fable 5 и Kimi K2.7 Code на тех же задачах местами скатывались в alt-тексты и заглушки. Тот же прием работает и с зависимостями: K3 продумывает использование библиотек для скролл-анимаций и графиков прямо в рассуждениях.
Важная оговорка: лидерборды у героев разные — Sol первая на Web Design (Non-Agentic), K3 на single-shot Frontend Arena, — так что вывода “K3 победила Sol” из этих разборов не следует. Следует другое: на одном бенчмарке сосуществуют три рабочие стратегии дизайн-вкуса, каждая со своей ценой. GLM 5.2 не выучила плохое — дешево, но шаблонно. Sol выучила и подавляет, оставаясь быстрой и дешевой. K3 итерирует в голове — и платит за это временем и токенами.
P.S. Поддержать меня можно подпиской на канал “сбежавшая нейросеть” [6], где я рассказываю про ИИ с творческой стороны.
Автор: runaway_llm
Источник [7]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/33466
URLs in this post:
[1] разбор GPT-5.6 Sol: https://notes.designarena.ai/how-openais-sol-finally-learned-design-taste/
[2] разбор: https://x.com/DesignArena/status/2080359813947773334
[3] Внимание: http://www.braintools.ru/article/7595
[4] обучения: http://www.braintools.ru/article/5125
[5] памятью: http://www.braintools.ru/article/4140
[6] “сбежавшая нейросеть”: https://t.me/ai_exee
[7] Источник: https://habr.com/ru/articles/1062478/?utm_campaign=1062478&utm_source=habrahabr&utm_medium=rss
Нажмите здесь для печати.