chimera skillcard-bench
A/B reasoning with vs without injected TRS skill cards. Calls real models.
Options
--tasksstrdefault:'hard'Task suite: hard | big | demo. 'big' = 24 traps for a tighter paired CI.
--kintdefault:1How many cards to retrieve per task.
--min-overlapintdefault:2Relevance gate: inject a card only on >= N shared query terms (0=off).
--max-linesintdefault:3Render budget: max lines per injected card.
--use-storebooleanBench your own learned cards (skills.json) instead of the demo set.