Как риторика может взломать оценки ИИ-ревьюеров? Разбор риторической чувствительности ИИ-систем научного рецензирования
Использует 4200 рукописей, полученных из 120 заявок ICLR 2026, чтобы проверить, как шесть риторических измерений (фрейминг доказательств, позиция новизны, фрейминг охвата и т.д.) сдвигают оценки пяти LLM-ревьюеров при стандартном и строгом протоколах. Фрейминг доказательств и позиция новизны дают наибольшие контрасты оценок; низкие оценки стремятся расти, высокие — снижаться, а строгое рецензирование снижает среднюю общую оценку на 1,36 балла без снижения риторической чувствительности.
Почему это важно
Контролируемый эмпирический ответ на вопрос, затрагивающий каждый пайплайн LLM-as-judge: какие риторические ходы наиболее надёжно двигают оценку и насколько надёжно ревьюеров можно рестабилизировать изменениями протокола.
Важность: 2/5
базовый уровень 2 (без заметных повышений)