#interpretability
- Глобальное рабочее пространство в языковых моделях Anthropic research
- Насколько прозрачна DiffusionGemma? Исследование интерпретируемости сокращает разрыв с авторегрессионными моделями Google DeepMind research
- Маска — не модель: аудит prefix-инвариантности в attention, state-space и гибридных sequence-моделях research
- Natural Language Autoencoders: превращение внутренних состояний Claude в текст Anthropic research
- Anthropic представляет Natural Language Autoencoders для масштабируемой интерпретируемости LLM Anthropic research
- Judge Circuits: механистическое объяснение непоследовательности LLM-as-judge по форматам research
- CiteVQA: бенчмарк атрибуции доказательств для надёжной document intelligence (178 апвоутов на HF) Peking University / Shanghai Artificial Intelligence Laboratory research
- Вмешательства SAE ненадёжны: подавленное поведение восстанавливается после интервенции Hong Kong Polytechnic University research
- BadWAM: когда модели «мир-действие» правильно мечтают, но неправильно действуют research
- «Супервеса» в LLM и провал избирательного обучения Amazon Web Services research
- Quantifying Faithful Confidence Expression in Large Reasoning Models Yale NLP research
- Анатомия пост-обучения: использование интерпретируемости для аудита и исправления данных предпочтений research
- Формализация латентных мыслей: аксиоматический фреймворк для оценки репрезентаций рассуждений LLM University of British Columbia research
- GradCuit: градиентный поток с распределением ответственности обеспечивает устойчивое и интерпретируемое рассуждение в латентном пространстве во время инференса research
- Anthropic ослабила классификаторы биобезопасности Claude Fable 5, сократив ложные блокировки на 85% Anthropic research
- Кража трасс рассуждений из проприетарных LLM API research
- LLM Safety From Within (SIREN) University of Toronto CSSLab / McGill / LMU Munich research