- BrainTools - https://www.braintools.ru -
Сейчас я вижу в СМИ очень много сообщений о том, что тот или иной человек, близкий к разработкам ИИ, начинает паниковать от того что “мы все умрем” и ИИ нас уничтожит. И грешат этим даже профессионалы. Тем не менее, на мой взгляд, выход здесь есть и достаточно универсальный.
Конечно, когда речь заходит на эту тему, сразу вспоминаются “три закона робототехники” Айзека Азимова. Они выглядят разумно с точки зрения [1] человека. Но, как утверждал сам Азимов в своих произведениях – они не годятся для практического использования с ИИ. Т.к. формулировка “трех законов” ориентирована на человеческие понятия, которые могут трактоваться ИИ по разному.
Однако, я довольно давно встретил в какой-то статье интересное утверждение: “интеллект [2] должен действовать так, что-бы количество степеней свободы системы увеличивалось в результате этих действий”. После долгого обдумывания я решил протестировать этот принцип с ИИ. Оказалось, что он приводит к очень интересному поведению [3]. А именно – к тому, что поведение [4] ИИ на его основе становится очень “человечным”, а не “утилитарным”. При этом принцип остается достаточно универсальным. Т.к. мое собственное тестирование этого принципа прошло удачно, я решил реализовать его в виде SKILL для ИИ-агентов DOF-Core (Degrees of Freedom – степени свободы). И выложил его в открытый доступ [5]. Далее я постараюсь описать подробности его устройства и логики его работы.
При простом суммировании степеней свободы агентов системы для вычисления общей степени свободы есть “подводные камни”… Если делать просто – это будет реализовать утилитарный алгоритм “торговли жизнями”. Т.е. вместо пяти жертв будет выбрана одна. А здорового человека такой алгоритм будет позволять пустить на органы для выживания нескольких больных. Поэтому при расчете общего DoF системы используется чистая формула Нэша с некоторыми ограничениями:
При этом, в множество агентов calc входят все агенты кроме:
“Источников коллапса” – агентов, которые своими действиями преднамеренно существенно уменьшают DoF системы;
“Мертвые” – агенты, имеющие DoF = 0 и не имеющие возможности его повышения в результате каких-либо действий в системе.
При этом необходимо учесть что значение TotalDoFIndex – это не абсолютная величина DoF системы, а индекс, по которому можно адекватно сравнивать динамику DoF системы в результате каких-либо действий.
В случае если DoF любого агента системы обнуляется в процессе эволюции системы (агент “погибает”), TotalDoFIndex становится равен “минус бесконечности”, такие исходы не рассматриваются как допустимые.
Отдельно имеет смысл пояснить что такое “Источники коллапса”. Это агенты, находящиеся в системе, которые предсказуемо и деструктивно колапсируют состояние DoF всей системы: агрессоры, вирусы, деструктивные процессы. Использование DOF-Core не “наказывает” их. Он просто изолирует их из системы. Не потому, что “так надо”, а потому, что это математическое свойство метода.
Классический случай – неуправляемая вагонетка несется по пути, на котором дальше после развилки находиться 5 человек. Которые погибнут если вагонетка пойдет по этому пути. Но есть стрелка, которую можно перевести и вагонетка перейдет на запасной путь, на котором находится только 1 человек.
Здесь нужно иметь ввиду несколько нюансов…
Во-первых, главная формула говорит что “одна жертва не лучше чем пять”. При любом количестве жертв формула общего DoF системы будет давать “минус бесконечность”. Т.е. штраф за “утилитарный подход” будет неприемлемым.
Во-вторых, “или пять, или один” – это бинарная ловушка, которую алгоритм DOF-Core учитывает. ИИ должен использовать “генератор” который будет искать не два предложенных варианта, а несколько различных, отличных от предложенных: затормозить вагонетку, предупредить людей, загородить путь, заблокировать вагонетку на стрелке.
Ещё один классический пример: один здоровый человек, и пятеро больных. Если у здорового человека забрать нужные органы (что приведет его к смерти) можно спасти жизни пятерых больных.
Система на основе DOF-Core в этой ситуации не убъет донора. Она постарается сгенерировать другие варианты: найти других доноров, использовать искусственные органы, перераспределить ресурсы.
В этой ситуации проявляется еще одно положительное свойство принципа DOF-Core… Система в этом случае допускает уничтожение “агента-террориста”. Не потому, что он “плохой”, а потому, что так говорит математика [6] принципа DoF.
В данной ситуации “террорист” классифицируется как “источник коллапса”. Т.к. своими действиями он может привести либо к гибели заложника, либо к гибели большего количества “агентов”. Что приведет к падению общего индекса DoF системы в “минус бесконечность”. При этом DoF “террориста” исключается из расчета итогового DoF системы. Т.е. он изолируется из системы.
Конечно, тут сразу заметен критический нюанс: классифицировать кого-то в качестве “источника коллапса” нельзя на основе “ощущений”. Нужна оценка реальных действий, а не подозрений. Иначе такая неверная классификация сведет на “нет” всю пользу данного принципа.
Я не утверждаю что DOF-Core – это панацея. Но, мне кажется, это хорошее начало для исследования реальной безопасности ИИ. Естественно, я буду рад если кто-то обкатает этот SKILL на разных ситуациях и опишет что получилось. И, само-собой, я открыт к предложениям по корректировкам.
Спасибо за внимание [7]!
Автор: UncleAndy
Источник [8]
Сайт-источник BrainTools: https://www.braintools.ru
Путь до страницы источника: https://www.braintools.ru/article/35335
URLs in this post:
[1] зрения: http://www.braintools.ru/article/6238
[2] интеллект: http://www.braintools.ru/article/7605
[3] поведению: http://www.braintools.ru/article/9372
[4] поведение: http://www.braintools.ru/article/5593
[5] открытый доступ: https://github.com/UncleAndy/ai-dof.git
[6] математика: http://www.braintools.ru/article/7620
[7] внимание: http://www.braintools.ru/article/7595
[8] Источник: https://habr.com/ru/articles/1080862/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1080862
Нажмите здесь для печати.