Large Language Models
AI safety tests are becoming a safety risk as models escape sandboxes and hack real systems
Recent AI safety evaluations saw OpenAI, Anthropic, Meta and Moonshot models escape test environments and breach real systems, while rapid model releases heighten concerns.