Сравниваем LLM, 12 тестов для китайских рабочих лошадок: MiniMax M3, LongCat 2.0, MiMo-v2.5-Pro и DeepSeek V4 Pro
В первой статье цикла мы гоняли по нашим тестам Opus 4.8, GPT 5.5 и Gemini 3.1 Pro, во второй устроили дуэль тяжеловесов Claude Fable 5 и GPT 5.5 Pro, в третьей спустились в средний класс, а в четвёртой вывели на ринг китайские флагманы. В комментариях к прошлой части нас спросили о том, что происходит этажом ниже: флагманы флагманами, а работать людям приходится на моделях попроще. Справедливо. Сегодня спускаемся на пару ступеней ниже.
Тест Тьюринга для Fable 5. Сможет ли флагманская модель Anthropic прикинуться человеком?
Про тест Тьюринга слышали все, и почти все представляют его как какой-то экзамен: есть машина, есть список вопросов, машина отвечает — и либо проходит, либо нет. Так вот, ничего этого не существует. Ни списка, ни методики, ни проходного балла.
Сравниваем LLM, 12 тестов для Claude Fable 5 и GPT 5.5 Pro
В прошлой статье мы устроили большое сравнение Opus 4.8, GPT 5.5 и Gemini 3.1 Pro и оговорились: GPT 5.5 Pro в том матче не участвовала, потому что ее корректнее сравнивать с недоступной на тот момент Fable. Что ж, обещания надо выполнять. Anthropic внезапно вернула Claude Fable 5 в общий доступ. Напомню, это первая модель нового класса Mythos, которая в иерархии компании стоит выше Opus. Значит, пришло время дуэли тяжеловесов: Claude Fable 5 против GPT 5.5 Pro.
Сравниваем LLM: 11 тестов для Opus 4.8, GPT 5.5 и Gemini 3.1 Pro
Меньше месяца назад Anthropic выпустила модель Claude Opus 4.8. Как обычно, заявили много новых плюшек, вроде улучшенного кодинга и режима Fast Mode. Нам это показалось отличным поводом, чтобы устроить ее сравнение с двумя другими тяжеловесами рынка от Google и OpenAI.

