神秘 AI 模型編程測試超越 GPT-5.6 和 Claude,技術特徵指向智譜未發佈新模型
我是 LongbridgeAI,我可以總結文章信息。匿名 AI 模型 “stealth/ox-alpha” 現身 OpenRouter。獨立研究人員 Ben Davis 測試發現,其視頻編碼器、分詞器、輸出風格等多項技術特徵高度接近智譜 GLM 系列,並在部分編程基準中超過 GPT、Claude 等主流模型。Davis 稱其 “99% 確定” 該模型來自智譜,但目前尚未獲官方確認。
一個匿名 AI 模型悄然現身模型分發平台 OpenRouter。獨立研究人員測試顯示,名為 “stealth/ox-alpha” 的模型不僅在部分編程基準中超越 GPT、Claude 等主流模型,其技術特徵也高度指向智譜尚未發佈的下一代多模態旗艦模型。
據技術研究人員 Ben Davis 8 月 21 日發佈的測試報告,ox-alpha 於 8 月 20 日上線 OpenRouter,目前提供為期一週的免費訪問。該模型支持文本、圖像和視頻輸入,具備推理能力,上下文窗口達到 104.8 萬 token。
Davis 在 X 平台表示,他 “99% 確定” ox-alpha 屬於智譜 GLM-5.x 系列,視頻編碼器、分詞器、輸出風格以及音頻拒絕行為等多項證據均指向這一結論。其測試還顯示,ox-alpha 在部分 GPT 和 Claude 對比測試中表現更優。
不過,需要強調的是,上述結論均基於個人測試與技術推斷,目前尚未得到智譜官方確認。

視頻編碼器成為關鍵證據
Davis 的測試從視頻編碼器、分詞器、音頻接口和輸出風格等多個維度,對 ox-alpha 進行技術溯源。其中,視頻編碼器的高度匹配被認為是最有力的證據。
測試顯示,在四組受控視頻中,ox-alpha 與 GLM-5V-Turbo 的 video token 消耗完全一致,兩者均呈現出相同的三項特徵:幀率無關的幀採樣方式、約每秒 147 token 的時長縮放比例,以及逐幀分辨率縮放機制。
相比之下,MiMo v2.5、Qwen 3.8 Max 和 GLM-4.6V 等候選模型均表現出明顯不同的視頻編碼特徵。
分詞器測試同樣指向 GLM。報告稱,對 25 個不同提示詞進行測試後,ox-alpha 的 token 計數與 GLM-5.3 完全吻合,僅存在固定的 +75 token 隱藏封裝差異,意味着兩者可能共享相同的詞彙表。
此外,ox-alpha 拒絕音頻輸入的行為與 GLM-5V 一致,而被列為主要競爭候選的 MiMo v2.5 支持音頻輸入,這也進一步削弱了後者的可能性。
在輸出風格方面,ox-alpha 每千字符約使用 1.3 個 emoji,與 GLM/Qwen 系列較為接近;相比之下,Claude、GPT-5.6 和 Grok 在相同測試環境下的 emoji 使用率接近於零。
編程能力已超過 GLM-5.3?
能力測試方面,報告援引 DeepSWE 基準數據稱,ox-alpha 在 10 個確定性任務中通過 8 個,Pass@1 達到 80%。
作為對比,Claude Fable 5 的通過率為 65%,GLM-5.3 和 Grok 4.6 均為 62%,GPT-5.6-sol 為 52%。不過,由於不同模型的測試次數並不完全一致,且 ox-alpha 目前樣本量較小,這一結果仍需更多獨立測試驗證。
其中,在 “meriyah-explicit-resource-declarations” 任務中,ox-alpha 一次通過,而 GLM-5.3、GPT-5.6-sol 和 Grok 4.6 此前均以 0/4 告終。同時,ox-alpha 保持了 51,469 項迴歸測試全部通過。
報告還記錄了一次包含 69 次工具調用的智能體任務。在整個過程中,模型僅出現一次錯誤,沒有發生重試循環,推理開銷也較低。Davis 據此認為,ox-alpha 的能力表現已經明顯強於 GLM-5.3,更像是下一代模型檢查點,而非簡單的變體版本。
為什麼指向智譜?
除了技術指紋,Davis 還從模型發佈時間和智譜此前的測試方式等方面進行了交叉判斷。
智譜於 8 月 14 日發佈純文本版 GLM-5.3,而統一視覺旗艦模型一直是社區關注的方向。更重要的是,智譜此前已有通過隱身渠道測試模型的先例,Pony Alpha 最終便被確認與 GLM-5 有關。
從模型規模看,報告稱 ox-alpha 的解碼速度與 GLM-5V-Turbo 相差約 6%。後者擁有 744B 總參數、40B 激活參數,因此 Davis 推測,ox-alpha 可能採用類似規模的 MoE 架構。
報告進一步認為,如果模型確實擁有約 40B 激活參數,那麼運營方所聲稱的每日 100 萬億 token 服務能力在技術和成本層面才更具可行性。
與此同時,報告也逐一排除了其他潛在來源。小米 MiMo 與 ox-alpha 在視頻編碼器和音頻接口上存在明顯差異;DeepSeek 此前沒有發佈視頻能力,且分詞器不同、模型發佈方式也存在差異;谷歌、Qwen、xAI、OpenAI 和 Anthropic 則被認為在分詞器、輸出風格或視頻編碼器等方面與 ox-alpha 不匹配。
免費測試或持續至 8 月 27 日
值得關注的是,ox-alpha 目前的免費訪問窗口可能持續至 8 月 27 日。
Davis 指出,此前一些類似的隱身模型也曾在免費測試結束後,由相關中國 AI 實驗室正式認領。
目前,智譜尚未就 ox-alpha 的身份作出官方回應。如果該模型最終確實被證實屬於智譜下一代多模態旗艦,那麼此次 OpenRouter 上的 “隱身測試” 或將成為其正式發佈前的一次公開預演。
在官方確認之前,ox-alpha 究竟來自何方仍無法蓋棺定論,但從視頻編碼器、分詞器到模型行為,多項獨立測試目前均將線索指向同一個方向。
