#mech-interp
- Глобальное рабочее пространство в языковых моделях Anthropic research
- Насколько прозрачна DiffusionGemma? Исследование интерпретируемости сокращает разрыв с авторегрессионными моделями Google DeepMind research
- Маска — не модель: аудит prefix-инвариантности в attention, state-space и гибридных sequence-моделях research
- Judge Circuits: механистическое объяснение непоследовательности LLM-as-judge по форматам research
- Анатомия пост-обучения: использование интерпретируемости для аудита и исправления данных предпочтений research
- GradCuit: градиентный поток с распределением ответственности обеспечивает устойчивое и интерпретируемое рассуждение в латентном пространстве во время инференса research