我是 LongbridgeAI,我可以总结文章信息。Appier 是一家以人工智能为基础的 Agentic AI 即服务公司,推出了一种名为能力校准的新框架,以提高大型语言模型(LLMs)的可靠性和效率。该框架允许人工智能代理在生成响应之前评估其解决问题的能力,从而解决 LLMs 中的过度自信和幻觉问题。研究表明,这种方法改善了决策和资源分配,使人工智能系统能够在企业环境中更有效地运作。Appier 旨在进一步开发该框架,以便在营销和广告领域应用,增强人工智能在商业决策中的作用
新框架提升企业人工智能的可靠性、成本效率和可扩展性
, /PRNewswire/ -- 作为一家以人工智能为核心的 Agentic AI 即服务(AaaS)公司,Appier 今天宣布其最新研究论文《大型语言模型的校准:从响应到能力》,这是其持续投资于先进人工智能创新的一部分。该研究引入了能力校准 [1]——一个旨在解决大型语言模型(LLMs)过度自信和幻觉挑战的新框架,使人工智能系统能够更好地评估自身解决特定任务的能力。
这项研究为人工智能代理提供了一项关键能力:在生成答案之前估计解决问题的可能性。通过引入可量化的自我评估机制,人工智能系统能够做出更可靠的决策,并更有效地分配计算资源,从而提高企业人工智能部署的可靠性、成本效率和可扩展性。
从响应准确性到问题解决能力 传统的 LLM 校准侧重于响应级别的信心,估计单个生成答案是否正确。然而,由于 LLM 输出本质上是随机的,相同的查询在多次尝试中可能会产生不同的响应。因此,单个响应往往无法反映模型的真实能力。
在实践中,组织更关心的是模型是否能够持续解决任务,而不是某个答案是否正确。Appier 的能力校准框架通过将评估从单一响应的信心转移到模型对特定查询的预期成功率来解决这一问题。这将评估目标从单个答案转移到模型更广泛的问题解决能力,提供了更实际的现实世界表现衡量标准。
教会人工智能代理 “了解自己的局限”“人工智能代理不仅应该生成答案,还应该理解自身能力的局限,” Appier 的首席执行官兼联合创始人余志翰表示。“通过能力校准,代理可以在响应之前估计其成功的概率,并智能地分配资源。简单的查询可以快速处理,而复杂的任务可以自动利用更强大的模型或额外的计算。这将人工智能从被动工具转变为一个主动管理资源、优化成本和提高决策质量的系统——这是扩展企业级人工智能代理的基本基础。”
实验结果:低成本下的高质量校准 该研究阐明了能力校准与传统响应校准之间的理论关系 [2],并评估了三种大型语言模型和七个涵盖知识密集型和推理密集型任务的数据集中的多种信心估计方法。测试的方法包括:
- 口头信心[3]:模型明确陈述其信心,以文本或百分比形式。
- P(True)[4]:根据生成信号估计答案正确的概率。
- 线性探测器[5]:使用内部模型信号评估其是否真正理解。
结果表明,线性探测器方法在成本和性能之间提供了最佳平衡,其计算成本甚至低于生成单个标记,同时保持可靠的信心估计。
两个关键应用:提高推理效率和资源分配 该框架支持两个实际用例。首先,pass@k[6] 预测,这是评估 LLM 在复杂任务中表现的广泛使用指标。能力校准的信心估计模型在 k 次尝试后产生至少一个正确答案的概率,而无需实际生成多个响应。其次,推理资源分配,根据预测的任务难度动态分配计算资源。更难的问题会获得更多的尝试,从而在相同的计算预算内解决更多任务。
为可信赖的人工智能代理建立决策基础 能力校准使人工智能代理能够在采取行动之前建立稳定且可量化的信心信号。这使得代理能够判断自己是否能够独立解决任务,何时调用外部工具,以及何时寻求人工帮助——帮助人工智能系统在不确定环境中更可靠地运行。
推进能力校准以推动 Agentic AI 应用 展望未来,Appier 的人工智能研究团队将继续推进能力校准,通过改进模型评估方法并将框架扩展到模型路由、人机协作和可信赖的人工智能系统等应用。利用 Appier 在人工智能和营销技术方面的深厚专业知识,这些研究进展将转化为产品能力,加速 Agentic AI 在广告和营销决策中的部署,帮助企业在日益复杂的数字环境中更高效地运作。
关于 Appier Appier(TSE: 4180)是一家以人工智能为核心的 Agentic AI 即服务(AaaS)公司,凭借尖端的广告技术和营销技术解决方案赋能商业决策。Appier 成立于 2012 年,旨在 “通过使软件智能化来简化人工智能”,努力帮助企业将人工智能转化为投资回报,提供广告云、个性化云和数据云解决方案。目前,Appier 在亚太地区、美国和欧洲、中东及非洲设有 17 个办事处,并在东京证券交易所上市。访问 www.appier.com 以获取更多公司信息,访问 ir.appier.com/en/以获取更多投资者关系信息。
| [1] 能力校准 – 一种评估 AI 模型整体问题解决能力的方法,通过估计其成功回答给定查询的概率,而不是判断单个响应。 |
| [2] 响应校准 – 一种传统的 AI 评估方法,测量模型对单个生成响应正确性的信心。 |
| [3] 口头信心 – 一种方法,模型在自然语言中明确说明其对答案正确性的信心,例如百分比或信心水平。 |
| [4] P(True) – 一种通过分析模型生成的标记概率分布来估计答案正确概率的技术。 |
| [5] 线性探测 – 一种轻量级线性分类器,训练于模型的内部表示,以分析模型是否学习了特定知识或能力,并估计信心。 |
| [6] pass@k – 一种常见的 AI 评估指标,估计模型在_k_次尝试中至少产生一个正确答案的概率,反映了在复杂任务中探索多条推理路径的必要性。 |
如需媒体查询,请发送电子邮件至 [email protected]
来源 Appier

