Task — engineering-spec@1
"Calibrated LLM judge + golden-set growth + internal LongMemEval-style benchmark"
draftTASK-MEMORY-245
TASK-MEMORY-245: Calibrated LLM judge + golden-set growth + internal LongMemEval-style benchmark
1. Description
judge agreement 75-90% vs human labels; 100+ golden cases; five ability buckets tracked per release
Migrated 2026-07-08 from the memory improvement backlog, folded into the task system as class: improvement. Source report refs: R46, R56.
Acceptance criteria
- [ ] judge agreement 75-90% vs human labels; 100+ golden cases; five ability buckets tracked per release