- 1定优先级
- 2猜真实结果
- 3找原因
第 1 轮 / 先定策略
你最想把预算花在哪里?
没有标准答案。请选择你进入实验前最相信的一条原则。
选择只记录你的判断,不生成预测分数。
第 2 轮 / 两个真实的 1K 选择集合
哪一组最终答题准确率更高?
下面都是已经回收、哈希校验的真实选择集合属性。先猜,不要只看“更丰富”。
请选择一组,真实方法名和三随机种子均值会立即揭晓。
第 3 轮 / 排除错误解释
为什么覆盖更广的 B 没赢?
请选择当前证据最支持的解释。注意:解释仍是待验证假设,不是已证明因果。
选择一个解释,证据会告诉你哪些可以排除。
挑战完成 / 真实负结果已解锁
更广的覆盖,不等于更高的当前任务收益。
Random-100082.94% ± 0.81%
COINCIDE-100078.26% ± 2.15%
配对差值−4.69 pp
COINCIDE 不是因为重复更多而失败:它覆盖了更多长尾技能,也降低了近重复率。但在 1K 小预算下,它减少了地理、物理、经济等训练覆盖;同时,TinyLLaVA 的选择表征与下游 Qwen 指标可能存在迁移和目标错配。
边界:只有 3 个随机种子,准确率的 95% 置信区间跨过 0。结果不支持“当前设置下 COINCIDE 优于 Random”,也不证明 COINCIDE 普遍无效。