AI的“心智理论”难题：Meta ExploreToM探索突破之路

2024年12月20日 16:25:21 来源：IT之家

　　Meta 公司携手华盛顿大学和卡内基梅隆大学，组建科研团队，合作开发了 ExploreToM 框架，旨在更有效地评估和训练大语言模型（LLM）的心智理论（Theory of Mind，ToM）能力。

　　心智理论

　　心智理论(Theory of Mind，ToM)是人类社会智能的基础之一，能让我们能够理解他人的想法、意图和信念。这种认知能力对于有效的沟通和协作至关重要，是复杂社交互动的支柱。

　　让 AI 也具备 ToM 能力，对于创建能与人类无缝互动的智能体至关重要，只是当前大型语言模型(LLM)在 ToM 方面仍面临巨大挑战。

　　现有的基准通常缺乏复杂性和多样性，导致高估模型能力。例如，许多基准测试基于简单的预定义场景，无法复制人类用来推断心理状态的复杂推理。

　　ExploreToM 框架

　　ExploreToM 通过生成多样化、可扩展的对抗性数据集，为提升 AI 的 ToM 能力奠定了坚实基础。该研究强调了当前模型的局限性，以及高质量训练数据对于弥合这些差距的潜力。

　　在数据集方面，ExploreToM 利用 A* 搜索算法和特定领域语言生成多样化、高难度的测试数据集，模拟复杂的社会情景，挑战 LLM 的认知极限。

　　ExploreToM 与现有基准测试不同，通过创建对抗性故事场景，旨在揭示 LLM 在 ToM 推理中的盲点。

　　此外该框架还引入了非对称信念更新机制，可以模拟不同角色对同一情况持有不同观点的复杂社交互动。

　　主流模型测试效果

　　GPT-4o 和 Llama-3.1-70B 模型在 ExploreToM 数据集上的准确率分别只有 9% 和 0%，凸显了现有 LLM 在处理复杂 ToM 推理方面的不足。

　　在 ExploreToM 数据上进行微调后，模型在经典 ToMi 基准测试中的准确率提高了 27 个百分点，证明了该框架的有效性。

　　文章内容仅供阅读，不构成投资建议，请谨慎对待。投资者据此操作，风险自担。

即时

第十四代英特尔® 酷睿™ 处理器(代号Raptor Lake S Refresh)采用了先进的Intel 7制程工艺。

奥维云网(AVC)推总数据显示，2024年1-9月明火炊具线上零售额94.2亿元，同比增加3.1%，其中抖音渠道表现优异，同比有14%的涨幅，传统电商略有下滑，同比降低2.3%。

“以前都要去窗口办，一套流程下来都要半个月了，现在方便多了!”打开“重庆公积金”微信小程序，按照提示流程提交相关材料，仅几秒钟，重庆市民曾某的账户就打进了21600元。

华硕ProArt创艺27 Pro PA279CRV显示器，凭借其优秀的性能配置和精准的色彩呈现能力，为您的创作工作带来实质性的帮助，双十一期间低至2799元，性价比很高，简直是创作者们的首选。

9月14日，2024全球工业互联网大会——工业互联网标识解析专题论坛在沈阳成功举办。