云计算百科
云计算领域专业知识百科平台

SocioBench: Modeling Human Behavior in Sociological Surveys with Large Language Models

你对这篇关于大语言模型社会行为模拟的论文关注度很有价值,它精准切入了当前LLM在社会科学应用中的关键痛点。文章核心是构建了SocioBench基准,揭示了现有LLM在模拟人类社会态度上的局限性,并提出了改进方向。

一、文章主要内容总结

1. 研究背景与问题

现有LLM虽在自然语言生成、认知模拟等领域表现突出,但缺乏大规模、系统性的基准来评估其与真实人类社会态度的一致性,无法满足社会科学实验中模拟人类行为的需求。

2. SocioBench基准构建
  • 数据来源:基于国际社会调查项目(ISSP)的标准化年度调查数据,涵盖30多个国家、超48万真实受访者记录。
  • 核心维度:包含10个社会学领域(公民身份、环境、家庭与性别角色等)和40多个人口统计学属性(年龄、性别、教育水平等)。
  • 版本划分:分为完整版(SocioBench-Full,48万+样本)和简化版(如SocioBench-5000,5000个样本),默认实验使用SocioBench-5000以平衡效率与覆盖度。
3. 实验设计与结果
  • 评估方式:通过角色扮演提示让LLM模拟特定人口统计学特征的受访者,以“准确率”为核心指标,对比模型预测与真实回答的匹配度。
  • 核心发现: <
赞(0)
未经允许不得转载:网硕互联帮助中心 » SocioBench: Modeling Human Behavior in Sociological Surveys with Large Language Models
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!