галлюцинация.

Тест Тьюринга для Fable 5. Сможет ли флагманская модель Anthropic прикинуться человеком?

Про тест Тьюринга слышали все, и почти все представляют его как какой-то экзамен: есть машина, есть список вопросов, машина отвечает — и либо проходит, либо нет. Так вот, ничего этого не существует. Ни списка, ни методики, ни проходного балла.

продолжить чтение

Сравниваем LLM, 12 тестов для Claude Fable 5 и GPT 5.5 Pro

В прошлой статье мы устроили большое сравнение Opus 4.8, GPT 5.5 и Gemini 3.1 Pro и оговорились: GPT 5.5 Pro в том матче не участвовала, потому что ее корректнее сравнивать с недоступной на тот момент Fable. Что ж, обещания надо выполнять. Anthropic внезапно вернула Claude Fable 5 в общий доступ. Напомню, это первая модель нового класса Mythos, которая в иерархии компании стоит выше Opus. Значит, пришло время дуэли тяжеловесов: Claude Fable 5 против GPT 5.5 Pro.

продолжить чтение

Сравниваем LLM: 11 тестов для Opus 4.8, GPT 5.5 и Gemini 3.1 Pro

Меньше месяца назад Anthropic выпустила модель Claude Opus 4.8. Как обычно, заявили много новых плюшек, вроде улучшенного кодинга и режима Fast Mode. Нам это показалось отличным поводом, чтобы устроить ее сравнение с двумя другими тяжеловесами рынка от Google и OpenAI.

продолжить чтение