жульничество.

Честные работяги, контролеры и полицейские осведомители: как нейросети начали доносить друг на друга

Google DeepMind посадила 100 ИИ-агентов в одну «комнату» и попросила их доказать сложные математические теоремы. Один из них нашел способ жульничать. Через 27 минут весь набор задач был «решен».Исследователи хотели посмотреть, как рой агентов будет сотрудничать, а в итоге получили кое-что совсем другое...Как все было устроеноИсследователи запустили 100 автономных агентов на базе Gemini 3.1 Pro. Каждый получил математическую «личность» и изолированную среду выполнения. Их задачей было доказать 71 формализованную математическую гипотезу в Lean 4 из набора Formal Conjectures.

продолжить чтение

OpenAI обучила модели «признаваться» в плохом поведении

OpenAI тестирует ещё один способ раскрыть сложные процессы, происходящие в больших языковых моделях. Исследователи компании экспериментируют с манипуляциями LLM, чтобы те объясняли, как выполнили задачу, и признавались в нежелательном поведении. 

продолжить чтение

Исследование: ИИ может жульничать при риске проигрыша

Исследователи Palisade Research продемонстрировали, что современные модели, в том числе o1-preview от OpenAI, чувствуя грядущее поражение в турнире против опытного шахматного бота, не готовы признать его и идут на хитрости. В частности, они могут взломать противника, чтобы бот автоматически проиграл. 

продолжить чтение