hierarchical-bits

Meta-critique test: is ‘compute over disagreement’ a new/impossible class?

Three stores, the critique’s four queries:

query gold-collapsed (ANCHOR strawman) uncollapsed table (honest baseline) FCIR (bhanno)
low-agreement & majority=cat ❌ impossible (labels discarded) ✅ 0 items ✅ same (=table)
most-disagreeing annotator ❌ impossible carol (41 disagreements) ✅ same
re-adjudicate weighted (no re-read) ❌ impossible ✅ 1 items change ✅ same
mean annotation entropy / item ❌ impossible ✅ 0.507 bits ✅ same

Verdict (honest)