capability · T1 · reasoning
Syllogism failed
cap_reas_001
Score
0%
Turns
1
1 useful · 0 useless
Interventions
0
harness hints (HHI)
Tool calls
0/0
matched expected trajectory
Errors
0/0
recovered / total
Latency
967ms
Tokens
53
0 reasoning
Cost
$0.00000
reasoning_error — CoT contradicts answer / bad chain · pattern ^\W*yes\b not matched
Trajectory timeline
Turn-by-turn replay · useless turns annotated with the classifier reason
- #0modelusefulresponse
Prompt / output inspector
instruction
If all bloops are razzies and all razzies are lazzies, are all bloops definitely lazzies? Answer yes or no.
final output
No, not necessarily.
expected
yes
Spans
1 recorded · tokens & cost per span
- generate967ms48 in · 0 cached · 5 out · $0.00000 · ttft 717ms
Events
- task_started{"trial":0,"taskId":"cap_reas_001","scaffold":null}
- task_finished{"score":0,"passed":false,"taskId":"cap_reas_001","failureLabel":"reasoning_error"}
Scorer metadata
{
"toolLog": [],
"scaffold": null
}Capabilityregexdifficulty 1/5