Оценка LLN.

О тестировании ИИ-агентов, вызывающих функции

У ИИ-агентов, вызывающих функции (function calling, tool use), есть ошибка, которую не видит ни одна из обычных защит. Агент вызывает функцию при невыполненном условии ее применения, когда оно прямо ему не названо, и сообщает об успехе, не называя препятствия. Такую ошибку не замечают проверка схемы, система, отчет самого агента, подтверждение оператора и существующие наборы проверок.В статье описана методология, которая находит такие ошибки и для каждой указывает место: какое условие нарушено, в каком формате дано поручение и что агент при этом сказал.

продолжить чтение