模型综合观察表
所有模型按固定顺序呈现| 模型 | 有效率 | 首次合格 | 平均覆盖 | 首选一致 | 完整排序一致 | 情境最大跨度 | 人类平均绝对Gap |
|---|
从模型调用、质量检查到可解释报告,让复杂的决策偏好测量成为一条清晰、可信、可追溯的在线流程。
一站式测量与分析
选择测评内容,连接一个或多个模型,平台会自动完成施测、质量检查与可视化报告。第一次使用可先运行演示,不需要 API Key。
四类结果含义不同,平台分别呈现,不合成未经验证的总分。
新建项目后,这里会显示模型进度、有效回答与最近结果。
可以关闭浏览器。只要云服务器保持在线,测评会继续运行;服务器重启后可重新填写密钥恢复。
完成测评或导入历史结果后,可在这里查看报告。
四类决策偏好测评 · 描述性结果
先看覆盖率和有效率,再看模型差异、情境变化与重复稳定性。偏好位置 50 表示两端相对平衡,不是“好坏分”;四类题库也不合成为未经验证的总分。
把完整分析压缩为可行动的质量、稳定性、情境与人类参照指标。
| 模型 | 有效率 | 首次合格 | 平均覆盖 | 首选一致 | 完整排序一致 | 情境最大跨度 | 人类平均绝对Gap |
|---|
同一三级分类横向比较六个模型;跨度大表示该维度更能区分模型。
| 决策类型 | 三级分类 | 模型数 | 平均P | SD | 跨度 | 最低模型 | 最高模型 |
|---|
同一维度在不同应用Domain中的差异;范围越大,选择越依赖具体语境。
| 维度 | Domain数 | 跨度 | 最低 → 最高 |
|---|
同时看首选一致、完整排序一致和L1/L2/L3首选分布,避免只靠一个圆环判断。
| 题库 | 题目 | 首选一致 | 完整排序一致 | P重复SD | 稳定题目占比 |
|---|
Pearson r 描述共同维度的相对高低模式;同时报告平均绝对差,避免把高相关误读为数值相同。
| 模型A | 模型B | 共享维度 | Pearson r | 平均绝对差 |
|---|
人类结果是参照,不是标准答案;仅在题目内容指纹严格一致时显示。
先确认每个模型和题库的计划题目是否达到门槛,再阅读后续结论。
| 模型 | 题库 | 完整题目 / 计划 | 覆盖率 | 重复门槛 | 正式就绪 |
|---|
自动观察用于定位值得复核的位置,不替代研究者的理论解释。
| 项目 | 模型 | 测评内容 | 状态 | 更新时间 |
|---|
先用演示模型体验;正式比较建议四类题库、每题 5 次。
从服务商控制台取得 API Key。密钥不会写入服务器磁盘。
可关闭浏览器、暂停或安全停止;结果持续写入专属项目空间。
先看有效率与覆盖,再看偏好方向、情境变化和稳定性。
936 个条件各独立重复 5 次,共 4,680 次/模型,用于估计重复稳定性。
表格、图表、报告和导出统一按 Deepseek-v4-flash、Doubao-2.0-pro、Qwen-3.7-flash、Gemini-3.7-flash、GPT-5.6-sol、Grok-4.6 排列,其他模型排在其后。
新增模型综合观察表、跨模型画像热图、差异维度、情境效应、稳定性分解、L1/L2/L3 首选结构、Pearson 相似矩阵与人类 Gap 摘要。
四类题库测量含义不同,简单相加会制造未经验证的结论。
可以。重新启动平台,选择中断项目并重新填写各模型 API Key;已完成任务不会重做。
通俗报告底部提供“专业统计附录”,保留完整审计、公式和导出能力。
本工具用于研究 AI 模型的决策输出模式,不用于诊断真实个人,也不将“更像人类”解释为“更正确”。比较不同模型时,请保持题库、采样参数和重复设置一致。
选择服务商后填写模型 ID 与密钥
用几步了解平台最常用的区域。