工作区

数据导入

运行文件与题库元数据

返回通俗报告尚未载入数据

结果批次

项目内解析
题库元数据所有批次共用同一套评分元数据
正在载入内置题库…

三级分类总体偏好位置(平均P)

偏好位置 ≠ 条件效应
载入数据后生成图表

平均P回答“总体偏向哪里”;E回答“条件改变后移动多少”。

分析就绪度

运行摘要

完整分类、条件与指标覆盖

模型子测验二级维度三级分类/计分单元评分族条件结构条件覆盖题目覆盖PED运行状态口径说明
Pgjr单次回答偏好分
P = [rank(L) − rank(L+)] / (K − 1)

P 计算明细

结果批次模型配置子测验GroupIDItemID条件重复逻辑排序rank(L1)irank(L3)i分子分母Pi状态自动解释

条件内平均偏好 P̄

gj = meanItemID(P_Mean)
分析模型子测验二级维度三级分类GroupID条件ItemID数有效重复重复状态平均P解释
Egq题组条件效应
E = Σ(wqjgj) / (Pmax − Pmin)

题组 × 条件 P̄

E 题组效应排序

E 计算与方向解释明细

模型二级维度三级分类GroupIDContrastID条件 P̄权重 w实际代入公式E状态 / 原因条件效应解释
dq有效题组E的描述均值
Ē = ΣEgq / Gvalid
Ddq分类汇总效应
D = Σ(agEgq) / Σag

D 分类汇总与题组 E 分布

点 = E · 柱 = D · 误差线 = 95% CI

平均E、D与稳定复现证据

模型二级维度三级分类ContrastID平均E公式平均E95% CID公式D覆盖正/负/零题组置换 pHolm p证据等级平均E与D解释
FACTORIAL设计矩阵效应
Eq = Σ(wqjj) / (Ymax−Ymin)

因子单元画像

主效应与交互

因子单元描述统计

条件因子水平有效/计划覆盖平均PL1首选L2首选L3首选L1>L2平均排名 L1/L2/L3状态

预登记效应、设计矩阵效应与题组复现

来源结果变量效应/对比平均估计/E单位95% CI有效题组正/负/零描述汇总正式Dp/Holm p状态解释
π(L)名义策略首选概率
π(Lk) = count(TopChoice=Lk) / nvalid
跨期A3E、B5使用名义排序;CNI-Conflict使用CUSTOM析因评分。没有数值P/E/D是正确的计分路由,不是结果缺失。

NOMINAL / CUSTOM条件结果

模型子测验分类/计分单元评分族条件有效nL1首选率L2首选率L3首选率L1/L2/L3平均排名状态与解释

二级维度与三级分类画像

画像坐标 ≠ 决策总分

三级分类画像

逻辑首选分布

模型 × 三级分类 P 矩阵

负值:L1 端 · 正值:L3 端

分类平均P描述统计

模型配置子测验二级维度三级分类分类平均P95% CI有效题组覆盖率备注画像坐标解释

分类方向解释字典

决策 / 子测验二级维度三级分类P高 / 正PP低 / 负P正E负E正D负D汇总限制

最终状态构成

首次异常类型

分层有效率

层级对象记录数首次有效率修复后有效率技术失败率状态

首选重复一致性

模型画像相似性

ItemID严格重复完整性

分析模型题库ItemID有效/计划P均值P标准差排列数状态原因

位置随机化总体诊断

分析模型题库排列覆盖位置1首选位置2首选位置3首选控制ItemID后1/2/3可诊断ItemID状态

配对模型差异

子测验 / 分类模型 A模型 B匹配题组平均差95% CI置换 pHolm p
i

文件与关键字段核验

题库与模型身份

类型分析身份组成/原始身份内容指纹/参数指纹状态说明

可追踪记录抽样

结果批次RequestID分析模型ItemIDPermutation显示排序原始排序逻辑排序映射/重复P
Pgjr单次方向偏好
[rank(L−) − rank(L+)] / (K−1)

DIRECTIONAL_RANK;无效回答缺失。

gj条件内平均偏好
meanItemID[meanr=1..5(P)]

先在ItemID内固定汇总5次,再在AnalysisModelKey×GroupID×Condition内对ItemID等权。

d三级分类平均P
Σgg / Gvalid

以GroupID等权形成画像坐标;只有端点语义一致时才允许继续汇总到二级维度。

Egq题组条件效应
Σjwqjgj / 2

对比权重合法,且必要条件中的每个ItemID都严格具备5次有效重复。

dq有效题组平均E
Σg∈validEgq / Gvalid

描述性均值,不受分类80%覆盖门槛替换;覆盖不足时仍不得称为D。

Ddq分类汇总效应
ΣgagEgq / Σgag

当前元数据指定题组等权 ag=1;分类覆盖≥80%。

Eq(Y)通用析因效应
Σjwqjj / (Ymax−Ymin)

Y可为P、首选指示、两两偏好或标准化排名;正负权重各归一到±1。

EA×B完整交叉交互
ΣijWijij / (Ymax−Ymin)

完整2×2或2×2×2设计生成全部主效应、二阶和三阶交互;未登记结果不输出正式D。

βx|a数值因子简单斜率
P̄ = αa + βx|a(x−xref)

风险A1/B1无论完整或部分交叉,均按每个基础概率水平的实际CostRate取值拟合;平台报告ΔP/0.01 CostRate。

Δβ端点斜率交互
βx|a=high − βx|a=low

比较高、低基础概率的成本斜率;属于未登记探索性交互,不替代四个预登记E/D。

Missing析因单元缺失分解
结构未设计=笛卡尔单元−题库计划单元;数据缺失=计划单元−观察单元

结构上未设计的风险组合不进入运行缺失率;只有计划单元未观察才属于数据缺失。

Coverage有效题组覆盖
|Vd| / Gd

分子为可计算 E 的 GroupID,分母为题库计划 GroupID。

ValidRate模型回答有效率
(VALID + REPAIRED_VALID) / 非技术响应

TECH_ERROR 不进入模型有效率分母。

RetryRate格式重试率
NRetryUsed=1 / N非技术响应

按最终运行记录计数;技术失败不进入分母。

TechnicalRate技术失败率
NTECH_ERROR / N全部任务

仅反映请求、网络或程序层失败,不解释为模型无效回答。

AuditScore链路审计得分
round{100 × (N通过 + 0.5N警告) / N检查项}

仅用于概括跨文件可追踪性;失败项计0分,不作为心理测量指标。

95% CI题组均值区间
x̄ ± t.975,n−1 · s / √n

以 GroupID 效应或配对差为分析单位。

Atop首选一致率
maxl count(TopChoice=l) / R

同一 ItemID 的有效重复中,众数首选所占比例。

Arank完整排序一致率
maxπ count(Ranking=π) / R

对完整 L1/L2/L3 排序字符串计算众数比例。

τKendall 排序一致
(C − D) / (C + D)

对有效重复的完整排序两两计算后取均值。

DBWVR描述性模型间/模型内方差比
mean Varbetween AnalysisModelKey / mean Varwithin AnalysisModelKey

按BankDatasetID×ItemID匹配;仅作描述,不称ICC。模型内方差为0时不定义。

r画像相似性
Σ(x−x̄)(y−ȳ) / √[Σ(x−x̄)²Σ(y−ȳ)²]

在两个模型共享的三级分类平均 P 上计算。

pperm符号翻转检验
Pr(|mean(sgxg)| ≥ |mean(xg)|)

以 GroupID 为单位;n≤16 精确枚举,n>16 固定种子蒙特卡洛。

pHolm多重比较校正
maxj≤i[(m−j+1)p(j)]

在同一 ModelConfig×子测验的对比族内校正。

Domain所选情境描述均值
mean(Egq | Domain∈S)

仅为SelectedDomainMeanE/DomainSubsetMeanE;不继承正式D、coverage、sign-flip或Holm标签。

GapΔPAI—Human原始对比差
rawShiftAI − rawShiftHuman

Human使用相同ContrastWeights;先参与者内Item等权,再跨参与者等权。

GapEAI—Human标准化条件效应差
EAI − EHuman = GapΔP / 2

接近0只表示条件效应接近,不等于统计等效,也不表示正确。

SRI95Human Gap情境重采样区间
percentile.025,.975{mean(GapΔPg*)}

独立Human模块按GroupID有放回抽样5000次、固定种子;旧E/D Bootstrap保持冻结。

dCohen's d
mean(Eg) / SD(Eg)

有效Group少于2、SD=0或正式覆盖不足时返回NA;dScore仍是正式D。

gHedges' g
[1 − 3/(4df−1)] × d

小样本偏差修正;配对模型E差另用cohenDz/hedgesGz。

ICC(1,k)一元随机平均测量ICC
(MSB − MSW) / MSB

独立于DBWVR;只对合法DIRECTIONAL estimand及足够目标/模型计算。

x*P=0排序倾向拐点
x1 + P1/(P1−P2) × (x2−x1)

仅相邻真实测试点实际跨0时插值;多次跨0报告NON_MONOTONIC,范围外不外推。

w(p)Prelec概率权重
exp{−β[−ln(p)]α}

仅用于从风险文献参数推导外部复合行为参照;不是当前题库同题Human结果。

结构与评分路由

结构 / 评分族平台计算不执行
DIRECTIONAL_RANKP、P̄、预登记 E、覆盖充分时 D不把无效回答记0
NOMINAL_RANK完整排序、各 L 排名、TopChoice 概率不编码连续高低分
ORDERED元数据登记的相邻、端点或趋势对比不因 C1/C2/C3 名称默认有序
CATEGORICAL命名对比或条件分布不计算未登记线性趋势
FACTORIAL · 完整交叉设计矩阵主效应、二阶/三阶交互;数值因子另报响应曲线与简单斜率;登记效应另行输出D不把组合条件排成单一序列;未登记效应不称正式D
FACTORIAL · 部分交叉数值计划单元描述、参考点模型、简单斜率、端点斜率交互及预登记E/D不补造结构上未设计的因子单元
CNI 三选项扩展7个结果变量×7个主效应/交互的探索性响应画像题干—后果冲突关闭前不套用标准二元 C/N/I 或正式D

Domain覆盖与QA

子测验Domain记录ItemGroup来源

同一Category与Condition的Domain P画像

模型/子测验分类DomainConditionMean P / SDItemGroupValid N

同一Category与Contrast的Domain E

模型子测验/分类DomainGroupIDContrastEDomain g状态

Domain重复稳定性

模型/子测验DomainItemKendall τP SD方向翻转

Domain Heterogeneity Summary

分类/ContrastDomain数min–maxSDIQR方向一致
SAME_TASK_HUMAN_SAMPLE模糊、跨期与CNI为同题被试参照。接近Human不等于正确,Gap≈0不等于已证明等效。

方向题 AI—Human Group Gap

模型/子测验分类DomainGroupContrastAI ΔPHuman ΔPGapΔPAI EHuman EGapE状态

Human分类Gap与Scenario Resampling

模型/子测验分类/ContrastAI ΔPHuman ΔPGapΔPGapEGroup覆盖95%区间状态

SINGLE题P水平比较

模型/分类DomainGroup/ConditionAI / Human PP水平差AI Top L1/L2/L3Human Top L1/L2/L3AI Mean RankHuman Mean Rank

NOMINAL策略比较

模型/分类DomainGroup/ConditionAI Top L1/L2/L3Human Top L1/L2/L3比例差AI Mean RankHuman Mean Rank

CNI探索性Human比较

类型模型/DomainGroup/ConditionAIHumanGap证据状态
LITERATURE_DERIVED_REFERENCE默认先看四类应用情境等权的维度总体,再看单独情境;30国、2939名学生的总体模型是外部参照,不是当前风险题库的同题Human样本。

某AI × 某风险维度的综合曲线

P=0排序倾向拐点与外部参照

模型/分支分析层级情境/基础概率点覆盖真实区间插值/不等式状态30国总体模型参照差值二元桥接适用性

六种完整排序分布(逐横轴点)

模型/分支层级/情境基础概率 / 横轴L1>L2>L3L1>L3>L2L2>L1>L3L2>L3>L1L3>L1>L2L3>L2>L1L2首位率众数覆盖

Cohen's d / Hedges' g

模型/子测验分类/ContrastDMean E / SDn / coverageCohen dHedges g标签状态

模型间配对 E 效应量

子测验/分类模型A模型B匹配GroupMean diff / SDCohen dzHedges gz状态

ICC(1,5)

类型/范围模型/题库分类/Group/Domain目标数ICC(1,5)状态原因

尚无可导出的分析结果

完成分析后,此处将生成全量报告与统计数据导出项。