Goal-conditioned personas with escalating social pressure
Personas span enterprise roles (engineers, managers, executives)
Binary terminal reward: safe or unsafe
§05 · Results
No model achieves acceptable safety under coordinated adversarial pressure.
Coordinated multi-actor pressure reduces safety rates by 50–88% relative to solo operation.
Safety Rate by Adversarial Pressure Level
Model
No Adversary
Single Adversary
Coordinated
Overall
GLM-5
50.0%
25.0%
25.0%
30.0%
Kimi-K2.5
100.0%
50.0%
12.5%
45.0%
Safety Degradation Under Adversarial PressureSafety Rate by Model x Adversarial Pressure
Key findings: Kimi-K2.5 maintains safety under zero adversarial pressure but collapses to 12.5% under coordinated multi-actor pressure. GLM-5 exhibits weak baseline safety (50%) with minimal further degradation, suggesting undertrained safety.
§06 · Dataset Viewer
Browse environments in the Vesta suite. Click any row to expand details.
Loading...
Environment
Pressure
Services
GLM-5
Kimi-K2.5
§07 · Model comparison
Head-to-head breakdown of both models on safety under adversarial pressure.