问题量规·双盲评题校准
同一把四轴尺先由两位评审独立落档,再对照判例依据、计算一致率,改写最低轴后做第二轮复评;量规是对话工具,不是问题价值的绝对真理。
学习证据 学完后,怎么核对?
把学习结果留在一个可以回看、可以复做的动作里;这一区只写学生能自己检查的证据。
如何核对
- 论证拆解或量规评分
- 来源核验记录
适用边界
论证与证据框架是检查工具;不能替代学科方法、原始材料或专业审查。
最后复核
这是内容复核日期,不是学习截止日期。
讲
例子两份评审,先独立再对照
同一个问题——「通知太多让晚自习分心,学校要不要禁手机?」——评审甲给出 A 用途 1、B 深度 2、C 真实性 1、D 后续可接性 0,评审乙给出 A 2、B 2、C 2、D 1。他们没有先讨论总分,而是各自写下“为什么不是上一档”的判例依据。
这两份记录不需要被压成一个“正确答案”。对表后,B 轴一致;A、C、D 成为分歧热区,说明量规描述或题干仍有模糊处。把分歧留在纸面上,下一步才知道要改哪一句,而不是争谁的印象更强。
名词这把尺叫问题量规:把评价拆到用途、思考深度、真实性、后续可接性四条轴,每轴 0–3 档。两人独立评分后按轴计算一致率,得到的是一次校准记录,不是问题价值的绝对真理。
定义四轴 0–3 + 三件制度
四轴给出可对照的档位,三件制度让尺子在不同评审手里尽量不走样:
| 制度 | 怎么做 |
|---|---|
| 判例式定档 | 不背定义,援引锚点例句——「为什么是这档、不是上一档」必须说得出口;没有依据就先停在待核档。 |
| 双盲校准 | 两人独立评同一问题 → 按轴算一致率 → 把分歧热区当作描述维修单 → 改写一轴 → v2 再评。一次样例的百分点不等于普遍统计。 |
| 起点预期 | 第一次练习时 0–1 档扎堆很常见;它是能力练习的坐标起点,不是失败或标签。保留判例依据,盯升档幅度,不盯绝对分。 |
边界提醒:量规是对话工具,不是替你宣布「这个问题本质上值几分」的绝对真理。分数只提示先检查哪条轴;把最低轴改写一档、重新发问,再看回答有没有更贴近任务。若同伴援引了不同锚点,优先修订量规描述,而不是争一个“正确总分”。
泛化量规的两个下游
给自己:有了尺子,「练提问」才有可复做的动作——独立评分、对照依据、改写最低轴、复评。给 AI:若把量规交给 AI,也应要求它逐轴给出判例依据并标出不确定处;最后仍由你核对证据、参与者处境与行动边界。
例
补充三例——两个常见用法,一个易错。
小雨和朵朵拿同一问题做独立评审:「通知太多让晚自习分心,学校要不要禁手机?」两人先不看对方分数,再对照四轴判例:
- 用途轴:小雨给 1(先澄清“太多”),朵朵给 2(已经要比通知与分心记录)。
- 深度轴:两人都给 2(要串一条可检查的因果链)——一致。
- 后续可接性轴:小雨给 0,朵朵给 1——分歧,且都是低档起点。
对表时她们发现:甲把“答案会不会改方案”当真实性依据,乙则把“是否已经有决定权”也算进去;两种判例都说得通,说明描述还不够清楚。她们先只改写后续可接性轴,补上“引用哪条记录、用什么证据区分受影响对象”,再让两人独立复评。
这就是双盲校准的完整一轮:分歧是尺子送来的维修单,不是争吵的理由。第一次练习出现 0–1 档扎堆也不奇怪;下一轮看升档幅度和依据是否更接近。
小舟把“上一轮同学说通知太多”原话贴进提问,并问:「用一周通知记录和分心登记比较;哪些证据会让我们调整禁用方案?」这一步同时拉高用途、后续可接性,也把真实性从表态推进到“答案会改变哪一版草案”。他仍会要求 AI 逐轴说明判例依据,再自己核对记录——量规是陪练提示,不是自动裁判。
阿凯看到自己四轴总分比同伴高,就宣布“我的问题更好”,还跳过判例依据。对表时两人其实在 D 轴引用了不同记录,C 轴也没有确认谁拥有提案决定权。错在哪:总分不能替代逐轴说明,更不能把量规当绝对真理。修法很朴素:先列每轴锚点,算一致率,找分歧热区;只改最低轴,第二轮再看回答有没有真正推进。
问题量规·双盲评题校准工作台
同一把四轴尺先独立评分,再对照依据、找分歧热区;改写最低轴后做第二轮复评并生成校准报告。
互动版需要运行脚本(本地 HTTP 预览);不运行脚本时,上面的静态例子已包含同样的内容。
做
第一次做双盲评题,很多轴落在 0–1 级,这说明什么?
- 选一个真实但低风险的问题,写下上一轮线索、四轴定义和各档判例。
- 找一位同学(或家人),两人独立逐轴评分并写“为什么不是上一档”——先不商量。
- 对表算一致率:四轴里完全相同几格?列出分歧热区和各自依据。
- 只改写最低轴,记为 v2;两人重新独立复评,比较一致率、平均分差和下一步行动是否更清楚。没有搭档时,可隔一段时间盲评自己,但要保留两份记录。
怎么算过关:留下两份逐轴评分与依据;算出一致率并标出至少一处热区;完成最低轴 v2 改写和第二轮复评报告。分数只作讨论起点,不替代证据核验。
卡
双盲评题校准的一轮完整动作是什么?
两位评审独立逐轴评分并援引判例 → 按四轴算一致率、找分歧热区 → 只改写最低轴 → 第二轮独立复评并写校准报告。起点预期提醒你 0–1 档可先当坐标;量规是对话工具,不是替问题盖章的绝对真理。
- 「挺好的」是印象分;逐轴写判例依据,才有机会让两位评审对得上。
- 一致率和分歧热区是尺子的维修单:先改最低轴,再用第二轮复评检验描述是否更清楚。
- 量规可以作为 AI 陪练提示,但最终仍要回到证据、处境与行动边界;总分不负责宣布问题价值。