题目级题库管线 · 端到端验证(sde/item_demo)

知因私教 · 2026-09-03 | 目标:把诊断引擎从「知识点级」升级为「题目级 + 连接型 Q 矩阵(一题多技能)」
数据声明:本轮无真实题目级数据集可用(官方 ASSISTments main 需自行下载,转换器已就绪 sde/item_data.py)。以下验证用「参数已知的 synthetic 题库」做算法自检—— 先造一个 α/slip/guess 已知的世界,再验证引擎能否把这些真值恢复回来;恢复误差即引擎真实精度。 此 synthetic 数据不用于任何效果宣称

synthetic 题库规模

5知识点
60题目
38多技能连接型题
350学生
21000作答记录
Q 矩阵:每题目测 1~3 个技能(连接型 DINA:短板技能决定上限)。作答按 P = g + (1−s−g)·∏α 采样。

① IRT 题级标定 → 学生能力 θ 恢复

θ 与真值(学生平均 α)相关:0.922(350 名学生,EAP 估计)。
题目级标定后,θ 落在统一能力标尺上:不同卷、不同时间的 θ 可直接相减得 Δθ(北极星)。

② CDM 连接型诊断 → 技能掌握 α 恢复

技能学生数MAE(平均绝对误差)相关系数
skill_43500.1140.853
skill_53500.1190.839
skill_13500.1270.806
skill_33500.1380.79
skill_23500.1370.788
全技能平均 MAE:0.127(α∈[0,1] 尺度,MAE≤0.15 为良好恢复、 <0.10 为高精度恢复;当前为连接型多技能解混下的良好水平)。相关 0.79~0.85。 连接型 Q 矩阵下,多技能题的短板效应被正确建模——这是知识点级退化的 CDM 不具备的能力。

③ 题级参数恢复(slip / guess)

题目估计 slip真值 slip估计 guess真值 guess
q10.0850.1010.2930.202
q20.0910.060.2690.179
q30.0940.1580.2490.218
q40.0930.1340.2670.27
q50.090.1710.2960.272
q60.0840.1730.290.153
q70.0860.0530.2120.125
q80.0790.1120.3020.272
q90.0910.1390.2510.183
q100.0870.1090.2810.244
q110.0840.1690.2720.263
q120.0920.1150.2090.159
q130.0820.1110.2980.232
q140.0930.130.230.17
q150.0870.0720.2770.255
q160.090.1270.2860.252
q170.090.0770.2560.223
q180.0870.1310.260.221
q190.090.110.2560.241
q200.0910.080.2080.144
仅展示前 20 题。slip/guess 由作答数据反解,与真值逐题可比。
sde/item_level | IRT=题级 3PL EM-MML 标定(irt.py)| CDM=DINA 连续化 FuzzyCDM(cdm.py) | synthetic 数据仅算法自检 | 真实接入:data/assist_items/ 放题目级 JSONL 后重跑本脚本即自动切真实数据(引擎零改动)