AI 新創公司 Anthropic 於週末公布 Claude Opus 5,將其定位為企業日常工作的 AI 助手,主要鎖定軟體工程、知識工作與科學研究等任務。 Anthropic 表示,Opus 5 的推理能力接近 Fable 5,但單次任務成本約為後者的一半。
Claude Opus 5 是 Opus 4.8 的升級版本,在維持相同 API 價格的情況下提升效能。該模型預設提供 100 萬 Token 上下文視窗,單次輸出上限提高至 12.8 萬 Token;API 每百萬 Token 的輸入與輸出價格分別為 5 美元及 25 美元。
程式開發與知識工作效能提升
Anthropic 表示,Claude Opus 5 在 Frontier-Bench 與 GDPval-AA 等程式開發及知識工作評估中取得領先成績。
在 Frontier-Bench v0.1 測試中,Opus 5 的成績超越參與評測的其他模型,達到當時最佳水準 (SOTA),並在成本較低的情況下,取得超過 Opus 4.8 兩倍的表現。
在 CursorBench 3.2 測試中,開啟最高思考深度 (max effort) 後,Opus 5 與 Fable 5 最高成績的差距為 0.5%,單次任務成本則約為 Fable 5 的一半。 Anthropic 指出,在 high 、 xhigh 與 max 等推理等級下,Opus 5 的成本效益均優於參與比較的其他模型。
強化問題解決與商業任務能力
在問題解決基準測試 ARC-AGI 3 中,Opus 5 的得分為 GPT-5.6 Sol 的 3 倍。在評估模型完成商業任務能力的 Zapier AutomationBench 測試中,Opus 5 的通過率則為第二名模型的 1.5 倍。
上述結果均來自 Anthropic 公布的資料,目前資料未提供完整測試條件、參與模型清單及第三方驗證結果。
科學研究能力超越前代模型
Anthropic 表示,Opus 5 在結構生物學、有機化學及生物資訊學等科學研究任務中,表現均超越 Opus 4.8 。
在根據光譜資料推論分子結構的測試中,Opus 5 得分較 Opus 4.8 提高 10.2%;在預測蛋白質序列如何影響其功能的能力測試中,成績也提高 7.7% 。此外,Opus 5 在生成風洞流體與細胞結構等視覺內容方面亦有所改善。
支援建模、漏洞識別與程式驗證
在實際工作應用方面,Opus 5 可協助處理 3D FreeCAD 建模任務,從原始像素資料擷取幾何資訊,並撰寫機械零件所需的電腦視覺程式碼。
Anthropic 也指出,Opus 5 的漏洞識別能力僅次於 Fable 5 。該模型曾在測試中,從一款熱門開原碼套件管理工具發現尚未被社群識別的真實漏洞,並完成修補。原文未說明該工具名稱、漏洞編號及揭露時程。
另一項案例中,一家金融交易公司的工程師使用 Opus 5 建立交易平台的市場資料饋送 (data feed) 模組。由於當時缺乏可用的即時資料來源驗證程式碼,Opus 5 另行建立測試框架 (test harness),透過模擬資料檢查程式碼的正確性。
Opus 5 已於個人方案與雲端平台上線
個人使用者可在 Claude Pro 方案中選用 Opus 5,Anthropic 將其定位為目前 Pro 方案能力最高的模型;在 Claude Max 方案中,Opus 5 則已成為預設模型。使用者也可透過 Claude.ai 、 Claude Code 命令列工具及 Claude Cowork 使用 Opus 5 。
企業市場方面,Opus 5 已向所有 API 使用者開放,並於 AWS 的 Amazon Bedrock 、 Google Cloud 的 Vertex AI 與 Claude on Google Cloud,以及 Microsoft Foundry 上線。
來源: Anthropic
