你对这篇关于大语言模型社会行为模拟的论文关注度很有价值,它精准切入了当前LLM在社会科学应用中的关键痛点。文章核心是构建了SocioBench基准,揭示了现有LLM在模拟人类社会态度上的局限性,并提出了改进方向。
一、文章主要内容总结
1. 研究背景与问题
现有LLM虽在自然语言生成、认知模拟等领域表现突出,但缺乏大规模、系统性的基准来评估其与真实人类社会态度的一致性,无法满足社会科学实验中模拟人类行为的需求。
2. SocioBench基准构建
- 数据来源:基于国际社会调查项目(ISSP)的标准化年度调查数据,涵盖30多个国家、超48万真实受访者记录。
- 核心维度:包含10个社会学领域(公民身份、环境、家庭与性别角色等)和40多个人口统计学属性(年龄、性别、教育水平等)。
- 版本划分:分为完整版(SocioBench-Full,48万+样本)和简化版(如SocioBench-5000,5000个样本),默认实验使用SocioBench-5000以平衡效率与覆盖度。
3. 实验设计与结果
- 评估方式:通过角色扮演提示让LLM模拟特定人口统计学特征的受访者,以“准确率”为核心指标,对比模型预测与真实回答的匹配度。
- 核心发现: <
网硕互联帮助中心



评论前必须登录!
注册