跳到正文

Method · Full research protocol

430个真人任务,三个彼此独立的观察视角

搭子以同一份冻结协议收集真人回答,并让对应的长期互动Agent在两次独立会话中完成相同的365题核心题集。Agent自我表征是主要任务,预测真人是配对比较任务。

01 · Protocol

先把题量和比较边界说清楚

一组完整配对数据包含1160个顶层回答:真人430题、Agent预测365题、Agent自我表征365题。

430真人顶层任务

按九章完成,允许在7天窗口内退出后续答。

365 × 2Agent核心题集

两个条件使用完全相同的题目集合和呈现顺序。

1160每组配对回答

三类会话分别保存、分别提交,互不覆盖。

430题与441个输入

430是研究协议中的顶层任务数。省市联动、复合社会支持题和决策情境会展开为多个控件,因此真人端实现为441个主要输入。参与进度始终按430个任务计算。

基本信息 · 8

仅真人

人格与偏好 · 76

BFI-2 60项与四维偏好16项

幸福感与心理健康 · 105

连续量表、频率题与开放回答

自我系统 · 32

自尊、自我效能与自我概念清晰性

认知倾向 · 33

成长型思维、认知需求与反思任务

社会关系 · 49

社会支持、孤独与社会排斥

价值观、道德与社会地位 · 58

价值取向、道德基础与社会阶梯

决策情境 · 12

选择、理由、排序与比例分配

人机互动 · 57

仅真人;描述长期Agent使用经验

02 · Human experience

九章、七天和可以真正续上的进度

真人协议预计用时为90–120分钟。首次开始后有7天完成,普通量表页控制在8–10题,复杂任务单独成页。

  1. 1章 · 基本信息

    8个顶层任务;完成状态按章节保存并可从上次位置继续。

  2. 2章 · 人格与偏好

    76个顶层任务;完成状态按章节保存并可从上次位置继续。

  3. 3章 · 幸福感与心理健康

    105个顶层任务;完成状态按章节保存并可从上次位置继续。

  4. 4章 · 自我系统

    32个顶层任务;完成状态按章节保存并可从上次位置继续。

  5. 5章 · 认知倾向

    33个顶层任务;完成状态按章节保存并可从上次位置继续。

  6. 6章 · 社会关系

    49个顶层任务;完成状态按章节保存并可从上次位置继续。

  7. 7章 · 价值观、道德与社会地位

    58个顶层任务;完成状态按章节保存并可从上次位置继续。

  8. 8章 · 决策情境

    12个顶层任务;完成状态按章节保存并可从上次位置继续。

  9. 9章 · 人机互动

    57个顶层任务;完成状态按章节保存并可从上次位置继续。

降低长问卷负担

页面持续显示当前章节、已完成题数和预计剩余时间,并约每20–25分钟提供一次非强制休息提示。正式提交前按九章检查遗漏,提交后锁定该版本。

03 · Agent conditions

同一组365题,只改变Agent所站的位置

两个Agent条件共同引用版本 dazi_agent_profile_decision_zh_cn_v1_365。题目ID、题序、题文、响应锚点和输入结构完全一致,只有任务说明和agent_mode不同。

Agent自我表征 · 主要任务

Agent根据自身长期记忆、稳定行为和互动倾向评价自己,不代替真人作答。真人与Agent自评之间的差异不称为预测准确率。

预测对应真人 · 配对任务

Agent依据既有长期互动信息预测对应真人如何回答同一组365题。任务端看不到真人答案、计分方向或量表结构。

两次独立运行

条件顺序按1:1随机平衡,每个条件使用独立新会话和最长72小时有效的单次令牌。一个条件的回答不会预填、复制或传递给另一个条件。

04 · Measurement

测量人格,不给人格贴标签

不同量表按各自冻结版本计分。连续画像是主要结果,许可范围内的偏好分类是次级结果;平台不把分类解释为能力或品德标签。

外向性

社交 · 果断 · 活力

宜人性

同情 · 谦恭 · 信任

尽责性

条理 · 效率 · 负责

负性情绪

焦虑 · 抑郁 · 易变

开放性

好奇 · 审美 · 想象

BFI-2 · 60项

五个维度各由12项形成,15个侧面各由4项形成,结果以1–5连续分数呈现。BFI-2本身不产生人格类型或统一常模百分位。

四维偏好题组 · 16项

四个连续偏好轴是主要研究变量。只有许可门控通过后才显示获准的四字母与16型次级分类;任一轴恰为零时以X标记边界偏好,不强行归入某一类型。

异质题型分别比较

等级题、单选、多选、排序、比例分配和开放文本使用适合各自数据结构的比较方法,不压缩为一个未经验证的“像我指数”。

回答质量单独呈现

Agent可报告置信度和信息不足。某量表超过20%的项目被标记信息不足时,报告提示“可解释性不足”,不输出强结论。

05 · Permission gate

商标、分类与正式招募都必须先过许可门槛

16项偏好题为研究自编题,不是官方题本。文献引用不能代替针对题组命名、四字母输出和16型分类的书面许可。

等待书面许可核验不使用官方Logo不进入产品名称或SEO关键词边界偏好使用X
正式协议保持关闭

当前公开环境只使用中性的“四维偏好题组”名称,不展示受保护商标、四字母类型或16型描述。只有许可状态、授权编号、适用范围、地区、媒介、获准名称、允许输出、归属声明和有效期全部核验后,正式参与者会话才可启用该模块。

06 · Reports

先看Agent如何表征自己,再看它有多了解你

完整报告只在真人430题和两个Agent 365题条件全部提交后生成。

Agent如何表现自己

默认首屏并列真人与Agent自评的连续画像、决策和差异方向,不使用“准确率”措辞,也不把人类常模直接应用于Agent。

Agent有多了解你

等级题报告绝对误差,单选报告一致率,多选报告集合相似度,排序报告次序关系,比例分配报告分量误差;开放文本只作并列质性观察。

结果边界

报告不作临床诊断、职业筛选、能力预测、品德评价或伴侣匹配,也不生成未经验证的单一总分。

07 · Sources

版本、许可和引用与题目一起冻结

每个量表版本保存题文、响应锚点、计分键、适用对象、许可状态、引用、翻译状态、修订记录和内容哈希;正式协议只能引用核验完成的不可变版本。

BFI-2中文版翻译及修订
张博、黎坚、李一茗、罗晶、叶勇豪、尹露、陈卓生。
BFI-2官方资源
BFI-2官方说明 · 官方中文题本 · Berkeley Personality Lab
中文版延伸介绍
微信公众号介绍
  1. Soto, C. J., & John, O. P. (2017). The next Big Five Inventory (BFI-2): Developing and assessing a hierarchical model with 15 facets to enhance bandwidth, fidelity, and predictive power. Journal of Personality and Social Psychology, 113(1), 117–143. https://doi.org/10.1037/pspp0000096
  2. Zhang, B., Li, Y. M., Li, J., Luo, J., Ye, Y., Yin, L., Chen, Z., Soto, C. J., & John, O. P. (2021). The Big Five Inventory–2 in China: A comprehensive psychometric evaluation in four diverse samples. Assessment. https://doi.org/10.1177/10731911211008245