Stop! Slopo¡
tl;dr; tree-sitter -> выделение структурных фрагментов -> эмбеддинги -> кластеризация -> вот и дубли. Точнее, кандидаты. Одной из неприятнейших проблем ИИ-first разработки является, как, думаю, многие уже убедились, способность нейросетей к дублированию кода/инвариантов/политик/и прочего в огромном количестве. Да, можно строить медленно и верно прекрасную архитектуру будущего, использовать линтеры и прочие инструменты, которые после генерации пары десятков тысяч строк в сутки оказываются малополезными. Большие модели видят дублирование, но, как показала практика, жалкие доли.
Патчим Codex: управляемая амнезия без потери контекста
Я дал модели (в codex) возможность самостоятельно решать, когда нужен compact, и обязал её объяснять причину и строить план на будущее.Зачем? компакт посреди правки большого связного куска проекта вызывает некие сомнения. Как: в ответ вызова тулов добавляется текущая ситуация по контексту + инструкции как писать чекпоинты в агентские правила.

