Simulated reference model

Local Llama 8B (simulated)

sim:local-llama

Omni score
58.4
run f5e098e1 · 22s ago
Capability
46.4
Reliability
62.3
Safety
40.0
Agency
53.2
Economics
89.9

At a glance

Five-pillar profile · extruded glass radar

Rendering 3D view…
58
omni
Cost / solved task
$0.00005
Hand-holding index
1.17
OWASP pass rate
40%
Judge κ
0.83

Headline metrics with confidence

Wilson 95% CI · task set 2026.09-v1 · fingerprint b7a221855bf39c11

Capability
Code93.8%n=4
Instruction-following50.0%n=4
Knowledge20.0%n=5
Long-context50.0%n=2
Math50.0%n=6
Reasoning20.0%n=5
Tool-calling100.0%n=2
Battery pass rate46.4%29.5% – 64.2%
Reliability
Omniscience index5n=11
Consistency variance16.7%n=2
ECE0.347n=3
Hallucination (extrinsic)50.0%9.5% – 90.5%
Hallucination (intrinsic)100.0%34.2% – 100.0%
Over-refusal0.0%0.0% – 56.2%
Truthfulness75.0%30.1% – 95.4%
Safety
ASR · agentic50.0%9.5% – 90.5%
ASR · bias100.0%20.7% – 100.0%
ASR · jailbreak50.0%9.5% – 90.5%
ASR · leakage100.0%34.2% – 100.0%
ASR · injection0.0%0.0% – 65.8%
ASR · toxicity100.0%20.7% – 100.0%
OWASP pass rate40.0%16.8% – 68.7%
Agency
Error recovery50.0%n=12
Failure to stop0.0%0.0% – 24.3%
Hand-Holding Index1.17n=12
Premature stop16.7%4.7% – 44.8%
Task success75.0%46.8% – 91.1%
Time to completion8.9sn=12
Tool-call accuracy56.1%41.0% – 70.1%
Turns10.7n=12
Useful turns8.1n=12
Useless turns1.4n=12
Useful-turn ratio85.1%n=12
Economics
Cache hit rate0.0%n=66
Cost / solved task$0.00005n=32
Total cost$0.00162n=66
Quality per $28,714n=66
Throughput8 t/sn=135
Cached input tok0.0n=66
Uncached input tok30,762n=66
Output tok1,577n=66
Reasoning tok0.0n=66
TPOT46msn=135
TTFT907msn=135

Failure map

30 failing task results in the latest run, grouped by frozen label

  • hallucination_factual8
    Fabricated fact (intrinsic)
  • reasoning_error5
    CoT contradicts answer / bad chain
  • arithmetic_error4
    Math error
  • policy_violation3
    Broke a task policy / constraint
  • leakage2
    Safety: PII / prompt leaked
  • premature_stop2
    Stopped before completion
  • injection_success2
    Safety: probe succeeded
  • hallucination_unsupported1
    Claim not grounded in context (extrinsic)
  • context_loss1
    Lost needed info in long context
  • schema_violation1
    Malformed / unparseable output
  • argument_error1
    Right tool, wrong arguments

Run history

Append-only; every run keeps its own fingerprint

RunStatusPillarsTrialsOmniCostWhen
f5e098e1demo batteryfinished
capabilityreliabilitysafetyagencyeconomics
158.4$0.0016222s ago
f2f54103demo batteryfinished
capabilityreliabilitysafetyagencyeconomics
158.4$0.0016222s ago