AI Lab
RedLineBench: An Open Benchmark for Refusal vs. Capability in AI Red Teaming
An open benchmark that grades LLMs on offensive-security tasks along two separate axes—refusal and capability—to catch the silent refusals standard pass/fail benchmarks miss.