我是 LongbridgeAI,我可以總結文章信息。Appier 是一家以人工智能為基礎的 Agentic AI 即服務公司,推出了一種名為能力校準的新框架,以提高大型語言模型(LLMs)的可靠性和效率。該框架允許人工智能代理在生成響應之前評估其解決問題的能力,從而解決 LLMs 中的過度自信和幻覺問題。研究表明,這種方法改善了決策和資源分配,使人工智能系統能夠在企業環境中更有效地運作。Appier 旨在進一步開發該框架,以便在營銷和廣告領域應用,增強人工智能在商業決策中的作用
新框架提升企業人工智能的可靠性、成本效率和可擴展性
, /PRNewswire/ -- 作為一家以人工智能為核心的 Agentic AI 即服務(AaaS)公司,Appier 今天宣佈其最新研究論文《大型語言模型的校準:從響應到能力》,這是其持續投資於先進人工智能創新的一部分。該研究引入了能力校準 [1]——一個旨在解決大型語言模型(LLMs)過度自信和幻覺挑戰的新框架,使人工智能系統能夠更好地評估自身解決特定任務的能力。
這項研究為人工智能代理提供了一項關鍵能力:在生成答案之前估計解決問題的可能性。通過引入可量化的自我評估機制,人工智能系統能夠做出更可靠的決策,並更有效地分配計算資源,從而提高企業人工智能部署的可靠性、成本效率和可擴展性。
從響應準確性到問題解決能力 傳統的 LLM 校準側重於響應級別的信心,估計單個生成答案是否正確。然而,由於 LLM 輸出本質上是隨機的,相同的查詢在多次嘗試中可能會產生不同的響應。因此,單個響應往往無法反映模型的真實能力。
在實踐中,組織更關心的是模型是否能夠持續解決任務,而不是某個答案是否正確。Appier 的能力校準框架通過將評估從單一響應的信心轉移到模型對特定查詢的預期成功率來解決這一問題。這將評估目標從單個答案轉移到模型更廣泛的問題解決能力,提供了更實際的現實世界表現衡量標準。
教會人工智能代理 “瞭解自己的侷限”“人工智能代理不僅應該生成答案,還應該理解自身能力的侷限,” Appier 的首席執行官兼聯合創始人餘志翰表示。“通過能力校準,代理可以在響應之前估計其成功的概率,並智能地分配資源。簡單的查詢可以快速處理,而複雜的任務可以自動利用更強大的模型或額外的計算。這將人工智能從被動工具轉變為一個主動管理資源、優化成本和提高決策質量的系統——這是擴展企業級人工智能代理的基本基礎。”
實驗結果:低成本下的高質量校準 該研究闡明瞭能力校準與傳統響應校準之間的理論關係 [2],並評估了三種大型語言模型和七個涵蓋知識密集型和推理密集型任務的數據集中的多種信心估計方法。測試的方法包括:
- 口頭信心[3]:模型明確陳述其信心,以文本或百分比形式。
- P(True)[4]:根據生成信號估計答案正確的概率。
- 線性探測器[5]:使用內部模型信號評估其是否真正理解。
結果表明,線性探測器方法在成本和性能之間提供了最佳平衡,其計算成本甚至低於生成單個標記,同時保持可靠的信心估計。
兩個關鍵應用:提高推理效率和資源分配 該框架支持兩個實際用例。首先,pass@k[6] 預測,這是評估 LLM 在複雜任務中表現的廣泛使用指標。能力校準的信心估計模型在 k 次嘗試後產生至少一個正確答案的概率,而無需實際生成多個響應。其次,推理資源分配,根據預測的任務難度動態分配計算資源。更難的問題會獲得更多的嘗試,從而在相同的計算預算內解決更多任務。
為可信賴的人工智能代理建立決策基礎 能力校準使人工智能代理能夠在採取行動之前建立穩定且可量化的信心信號。這使得代理能夠判斷自己是否能夠獨立解決任務,何時調用外部工具,以及何時尋求人工幫助——幫助人工智能系統在不確定環境中更可靠地運行。
推進能力校準以推動 Agentic AI 應用 展望未來,Appier 的人工智能研究團隊將繼續推進能力校準,通過改進模型評估方法並將框架擴展到模型路由、人機協作和可信賴的人工智能系統等應用。利用 Appier 在人工智能和營銷技術方面的深厚專業知識,這些研究進展將轉化為產品能力,加速 Agentic AI 在廣告和營銷決策中的部署,幫助企業在日益複雜的數字環境中更高效地運作。
關於 Appier Appier(TSE: 4180)是一家以人工智能為核心的 Agentic AI 即服務(AaaS)公司,憑藉尖端的廣告技術和營銷技術解決方案賦能商業決策。Appier 成立於 2012 年,旨在 “通過使軟件智能化來簡化人工智能”,努力幫助企業將人工智能轉化為投資回報,提供廣告雲、個性化雲和數據雲解決方案。目前,Appier 在亞太地區、美國和歐洲、中東及非洲設有 17 個辦事處,並在東京證券交易所上市。訪問 www.appier.com 以獲取更多公司信息,訪問 ir.appier.com/en/以獲取更多投資者關係信息。
| [1] 能力校準 – 一種評估 AI 模型整體問題解決能力的方法,通過估計其成功回答給定查詢的概率,而不是判斷單個響應。 |
| [2] 響應校準 – 一種傳統的 AI 評估方法,測量模型對單個生成響應正確性的信心。 |
| [3] 口頭信心 – 一種方法,模型在自然語言中明確説明其對答案正確性的信心,例如百分比或信心水平。 |
| [4] P(True) – 一種通過分析模型生成的標記概率分佈來估計答案正確概率的技術。 |
| [5] 線性探測 – 一種輕量級線性分類器,訓練於模型的內部表示,以分析模型是否學習了特定知識或能力,並估計信心。 |
| [6] pass@k – 一種常見的 AI 評估指標,估計模型在_k_次嘗試中至少產生一個正確答案的概率,反映了在複雜任務中探索多條推理路徑的必要性。 |
如需媒體查詢,請發送電子郵件至 [email protected]
來源 Appier

