题目级题库管线 · 端到端验证(sde/item_demo)
知因私教 · 2026-09-03 | 目标:把诊断引擎从「知识点级」升级为「题目级 + 连接型 Q 矩阵(一题多技能)」
数据声明:本轮无真实题目级数据集可用(官方 ASSISTments main 需自行下载,转换器已就绪
sde/item_data.py)。以下验证用「参数已知的 synthetic 题库」做算法自检——
先造一个 α/slip/guess 已知的世界,再验证引擎能否把这些真值恢复回来;恢复误差即引擎真实精度。
此 synthetic 数据不用于任何效果宣称。
synthetic 题库规模
5知识点
60题目
38多技能连接型题
350学生
21000作答记录
Q 矩阵:每题目测 1~3 个技能(连接型 DINA:短板技能决定上限)。作答按 P = g + (1−s−g)·∏α 采样。
① IRT 题级标定 → 学生能力 θ 恢复
θ 与真值(学生平均 α)相关:
0.922(350 名学生,EAP 估计)。
题目级标定后,θ 落在统一能力标尺上:不同卷、不同时间的 θ 可直接相减得 Δθ(北极星)。
② CDM 连接型诊断 → 技能掌握 α 恢复
| 技能 | 学生数 | MAE(平均绝对误差) | 相关系数 |
|---|
| skill_4 | 350 | 0.114 | 0.853 |
| skill_5 | 350 | 0.119 | 0.839 |
| skill_1 | 350 | 0.127 | 0.806 |
| skill_3 | 350 | 0.138 | 0.79 |
| skill_2 | 350 | 0.137 | 0.788 |
全技能平均 MAE:0.127(α∈[0,1] 尺度,MAE≤0.15 为良好恢复、
<0.10 为高精度恢复;当前为连接型多技能解混下的良好水平)。相关 0.79~0.85。
连接型 Q 矩阵下,多技能题的短板效应被正确建模——这是知识点级退化的 CDM 不具备的能力。
③ 题级参数恢复(slip / guess)
| 题目 | 估计 slip | 真值 slip | 估计 guess | 真值 guess |
|---|
| q1 | 0.085 | 0.101 | 0.293 | 0.202 |
| q2 | 0.091 | 0.06 | 0.269 | 0.179 |
| q3 | 0.094 | 0.158 | 0.249 | 0.218 |
| q4 | 0.093 | 0.134 | 0.267 | 0.27 |
| q5 | 0.09 | 0.171 | 0.296 | 0.272 |
| q6 | 0.084 | 0.173 | 0.29 | 0.153 |
| q7 | 0.086 | 0.053 | 0.212 | 0.125 |
| q8 | 0.079 | 0.112 | 0.302 | 0.272 |
| q9 | 0.091 | 0.139 | 0.251 | 0.183 |
| q10 | 0.087 | 0.109 | 0.281 | 0.244 |
| q11 | 0.084 | 0.169 | 0.272 | 0.263 |
| q12 | 0.092 | 0.115 | 0.209 | 0.159 |
| q13 | 0.082 | 0.111 | 0.298 | 0.232 |
| q14 | 0.093 | 0.13 | 0.23 | 0.17 |
| q15 | 0.087 | 0.072 | 0.277 | 0.255 |
| q16 | 0.09 | 0.127 | 0.286 | 0.252 |
| q17 | 0.09 | 0.077 | 0.256 | 0.223 |
| q18 | 0.087 | 0.131 | 0.26 | 0.221 |
| q19 | 0.09 | 0.11 | 0.256 | 0.241 |
| q20 | 0.091 | 0.08 | 0.208 | 0.144 |
仅展示前 20 题。slip/guess 由作答数据反解,与真值逐题可比。