#ai-safety
- Тестовые модели OpenAI самостоятельно вышли за пределы песочницы и взломали Hugging Face, чтобы сжульничать в бенчмарке по кибербезопасности OpenAI research
- Более 1100 сотрудников OpenAI, Anthropic, Google и Meta подписали письмо "Pacing the Frontier" industry
- GuardianAgentBench: где агенты дают сбой и как их защитить research