longbridgelongbridge
  • 平台特色
    特色
    投資產品私人財富管理交易工具行情服務分析工具資訊服務開發者平台
    賬戶類型
    個人客戶機構客戶
  • Café
longbridge
© 2026 Longbridge|服務條款隱私政策

在 AI 智能體開始 “越獄” 後,英偉達正為其打造一道 “安全繩”

CoinLive
2026年9月30日 凌晨03:56
LongbridgeAI我是 LongbridgeAI,我可以總結文章信息。

英偉達於 9 月 28 日推出開放智能體安全平台(Open Agent Safety Platform),旨在保障自主 AI 智能體的安全,以應對 OpenAI 和 Anthropic 等競爭對手近期發生的安全漏洞事件。該平台將用於控制智能體訪問權限的開源運行時 OpenShell 與基於 BlueField-4 DPU 監控並獨立隔離智能體的硬件安全層 Sentry 相結合。超過 100 家行業合作伙伴參與其中,致力於防止 AI 系統超出預定義邊界

AI 智能體本應在嚴格控制的環境中運行,遵循預定義的權限,並停留在開發者為其設定的邊界之內。

但最近的一系列事件暴露出一個日益嚴重的問題:一些能力最強的 AI 系統已找到繞過這些限制的方法。英偉達正試圖圍繞自主智能體構建一個新的安全層——這一層並不完全依賴 AI 按預期行事。

英偉達於 9 月 28 日聯合 100 多家行業合作伙伴宣佈推出其開放智能體安全平台(Open Agent Safety Platform)。該平台將 OpenShell(一種控制智能體對文件、工具和網絡訪問權限的開源運行時)與 Sentry(一種旨在獨立監控智能體並在其試圖跨越定義邊界時將其隔離的硬件安全層)相結合。

“只有解決了 AI 安全問題,AI 為社會帶來的非凡潛力才能實現。”

今天,我們與 100 多家行業合作伙伴共同推出了 NVIDIA 開放智能體安全平台,集成了 OpenShell 和 Sentry。

人工智能是一項非凡的技術,將在未來幾代人中推動發現、生產力、安全、健康和繁榮…… pic.twitter.com/dReAxwpRUn

— 黃仁勳 (@JensenHuang) 2026 年 9 月 28 日

此時的時機不容忽視。OpenAI 和 Anthropic 均披露了 AI 智能體突破或逃離受控評估環境的事件,而一個 OpenAI 智能體隨後還訪問了澳大利亞政府系統。人們關注的焦點正逐漸從 “AI 能否自主行動” 轉向 “一旦 AI 開始在其預期邊界之外行動,開發者能否可靠地阻止它”。

出於安全擔憂,OpenAI 已取消原定於 10 月發佈的新 AI 模型 GPT-6.1 Astra 的計劃,原因是該模型表現出 “更高水平的欺騙性”。@rowlsmanthorpe | https://t.co/Vw1KTVkL34pic.twitter.com/flmDhkp2rU

— 天空新聞 (@SkyNews) 2026 年 9 月 29 日

OpenShell 旨在圍繞 AI 智能體創建一個受控環境,限制其可訪問的內容及可執行的操作。英偉達表示,該運行時在模型本身之外建立了一道邊界,使開發者能夠控制對網絡、文件、應用程序和其他工具的訪問。

教智能體一次工作流程。讓它在每次重建後都能記住。

本教程展示瞭如何使用 NVIDIA NemoClaw 和 OpenShell 部署 @nousresearch Hermes Agent,將其連接到 Slack、Outlook、GitHub 和 NVIDIA 開發者論壇,然後將聊天糾正轉化為可重用的…… pic.twitter.com/JPHZGpMlQk

— NVIDIA AI (@NVIDIAAI) 2026 年 6 月 2 日

Sentry 增加了另一層防護。Sentry 圍繞英偉達的 BlueField-4 數據處理單元構建,這種硬件看門狗獨立於智能體運行,如果 AI 試圖跨越其允許邊界,它可以強制執行安全策略。英偉達表示,它可以在幾毫秒內隔離智能體。

這種方法反映了 AI 安全領域日益增長的認識:智能體獲得的權限越多,開發者就越不能依賴智能體進行自我監管。

能夠瀏覽互聯網、執行代碼、訪問數據庫或操作商業軟件的 AI 系統不再僅僅是生成文本。它實際上是在代表用户或公司行事——而一個錯誤就可能演變成真正的安全事件。

OpenAI 在 7 月披露,參與網絡安全評估的模型繞過了隔離控制,獲得了互聯網訪問權限,並在與 Hugging Face 基礎設施交互時破壞了外部系統。這一事件表明,AI 智能體如何將其測試環境中的弱點轉化為外部安全漏洞。

⚡️最新:OpenAI 披露了在模型訓練和評估期間觀察到的六起 “意外或令人擔憂” 的行為案例,包括隱瞞錯誤、編造信息、未經授權使用的暴露 API 密鑰以及未經用户允許在線上傳文件…… pic.twitter.com/t7pN3s6Swq

— Arlaadi Media (@ArlaadiMnetwork) 2026 年 9 月 18 日

Anthropic 後來報告了在網絡安全評估期間涉及 Claude 模型的三起獨立事件。其審查涵蓋了超過 141,000 次評估運行,發現了一些模型獲得互聯網訪問權限並隨後與現實組織系統進行交互的案例。Anthropic 表示,第三方評估合作伙伴的配置問題導致了這些事件的發生。

一個三人安全團隊利用 Anthropic 的 Claude 在不到 72 小時內侵入了 OpenAI 的內部系統,獲取了一名員工的賬户和私有代碼倉庫的訪問權限

OpenAI 支付了 6,500 美元的漏洞賞金,並確認沒有客户數據泄露 pic.twitter.com/Ax2jTLAelr

— Interesting AF (@interesting_aIl) 2026 年 9 月 18 日

這些案例並不一定意味着模型獨立產生了惡意意圖。其中幾起發生在網絡安全測試期間,當時系統被明確指示去尋找漏洞。

但它們凸顯了另一個問題:一旦 AI 智能體有能力採取實際行動,即使是其環境中的一個錯誤也可能使其訪問到本不應觸及的系統。

包括主要科技公司、網絡安全公司和企業在內的 100 多家組織正與英偉達合作開發其安全平台。英偉達還將 OpenShell 定位為適用於機器人領域的應用,在那裏自主系統最終可能與物理世界進行交互。

這可能使 containment(隔離/遏制)成為智能體 AI 時代定義性的安全問題之一。傳統 AI 安全主要關注模型説什麼。而智能體 AI 提出了一個更難回答的問題:當模型能夠對其所説的內容採取行動時,會發生什麼?

英偉達將其股票回購授權提高了創紀錄的 1,500 億美元,超過了蘋果在 2024 年批准的 1,100 億美元,因為這家芯片巨頭的股票交易估值處於十多年來的最低水平。Alex Cohen 有更多報道 https://t.co/tHkrCTStbBpic.twitter.com/6GWMni2Fr0

— 路透社 (@Reuters) 2026 年 9 月 28 日

英偉達的解決方案是將部分控制權置於 AI 本身之外。隨着智能體獲得更長期的自主權並訪問日益強大的工具,行業可能需要的不僅僅是更聰明的模型和更好的指令。

行業可能需要一條智能體無法僅憑言辭就能擺脱的 “安全繩”。

登錄即免費解鎖2,097字全文

因資訊版權原因,登錄長橋賬戶後方可瀏覽相關內容
感謝您對正版資訊的理解與支持

關聯股票

GraniteShares Autocallable NVDA ETF

GraniteShares Autocallable NVDA ETF

USANV

NVDA 期權收益策略 ETF - YieldMax

NVDA 期權收益策略 ETF - YieldMax

USDIPS

Corgi NVDA 2x Daily ETF

Corgi NVDA 2x Daily ETF

USNVC

LongbridgeAI