97视频在线观看免费高清完整版在线观看-69精品人人人人-爱的色放3-亚洲黄色一区-亚洲精品视频免费在线观看-男人天堂免费视频-久久久社区-日韩综合一区二区-色撸撸在线-蝌蚪av-国产乱淫视频-男生尿隔着内裤呲出来视频-人操人操-欧美鲁鲁-免费视频99-3级av-中国一级大黄大黄大色毛片-久久久欧美精品-99精品在线看-色峰视频-印度毛茸茸-国产福利毛片-国产极品999-69日韩-天天综合网国产

星空人工智能技術網

AgentOmnia:面向全場景能力擴展的Agent大模型后訓練技術實踐

近日,華為云大模型后訓練團隊發布技術報告《AgentOmnia: Scaling Agentic Models for Full-Scenario Applications》,提出面向全場景應用的Agent大模型后訓練體系AgentOmnia,探索如何推動Agent從“在專項測試中表現優秀”進一步確保“能夠適應不同用戶、業務系統和復雜任務”,從而提升其面向多類真實應用場景的通用能力。

大語言模型驅動的Agent正從工具調用走向與用戶和復雜環境的持續交互。然而,現有訓練與評測通常圍繞有限的領域或平臺展開。模型在單項benchmark上取得高分,并不代表它能夠穩定處理企業軟件、消費者服務、辦公文檔、數據分析和復雜規劃等不同任務。

針對這一問題,華為云大模型后訓練團隊提出AgentOmnia,探索Full-Scenario Agentic Scaling,即如何通過統一的任務空間,銜接數據構造、模型后訓練、評測診斷與持續迭代,系統擴展Agent大模型的全場景能力。

以Qwen3-30B-A3B-Thinking-2507為基礎模型進行Agentic后訓練,AgentOmnia-30B-A3B在全場景測評基準OmniaBench挑戰集上的任務通過率由9.16%提升至37.11%,提升覆蓋 76/90 個L1 domain及全部capability和atomic difficulty維度。此外,AgentOmnia在OmniaBench、τ²-Bench、DeepPlanning和VitaBench四項基準的宏平均由22.86%提升至41.69%,綜合得分超過多項同類型前沿工作。

999.jpg

AgentOmnia整體評測結果。 以Qwen3-30B-A3B-Thinking-2507為基礎模型,展示AgentOmnia在四項基準宏平均、跨基準表現,以及領域、能力和原子難度維度上的提升。

AgentOmnia以全場景分類體系定義任務空間,以環境、任務和軌跡合成構建訓練數據,再通過SFT與在線Agentic RL提升模型能力。評測結果和外部需求還可以進一步轉化為PRD,指導下一輪針對性數據構造。

AgentOmnia全場景Agent大模型后訓練體系。 全場景分類體系定義并度量任務空間,數據合成模塊構建可執行環境、任務與可靠軌跡,SFT和在線Agentic RL將其轉化為模型能力,評測診斷與PRD則進一步指導后續數據合成和模型迭代。

用統一坐標描述全場景能力

AgentOmnia建立了Domain × Capability × Atomic Difficulty三軸分類體系,覆蓋To-Consumer、To-Business和To-Employee三類應用,包括90個一級領域、354個二級領域、10類能力和8類原子難度因素。

該體系既用于規劃合成數據的覆蓋范圍,也用于評測后的細粒度診斷。同期發布的OmniaBench將其落實為包含1,431個任務的全場景Agent benchmark。

面向全場景Agent任務的三軸分類體系。Domain描述任務所在的應用場景,Capability描述完成任務所需的能力,Atomic Difficulty描述任務困難的原因,三者共同連接數據構造與評測診斷。

構建“困難但可驗證”的訓練數據

AgentOmnia共構建5,018個代碼驅動的有狀態環境、255,375個工具和52,361個任務。環境與任務采用雙向合成,并通過三類任務管線擴展不同推理結構:

DAG-based synthesis構建多工具依賴與長鏈工作流;

Program-based synthesis表達分支、循環和運行時數據依賴;

Solver-based synthesis覆蓋選擇、調度、規劃與全局約束優化。

與單純依賴教師模型生成答案不同,AgentOmnia使用程序、求解器、狀態變化、評分細則和驗證器建立獨立的正確性依據。在此基礎上形成53K個SFT樣本和5K個RL訓練任務。

AgentOmnia的全場景數據合成體系。 雙向環境—任務合成連接代碼驅動的可執行環境、DAG、Program和Solver三類任務管線,并進一步生成經過校驗的訓練軌跡。

讓困難任務真正產生學習信號

對于教師模型難以直接求解的任務,AgentOmnia在數據合成階段引入特權指導,幫助教師生成可靠軌跡;最終保留的軌跡仍須通過任務評分、邏輯一致性、證據grounding和泄漏檢查。

在線Agentic RL階段,Rollback-based Curriculum Reinforcement Learning會在一組rollout全部失敗時,從經過驗證的軌跡前綴恢復探索,再隨著模型能力提升逐步縮短前綴,使困難任務也能產生有效訓練信號。

AgentOmnia SFT與Agentic RL后訓練流程。 特權指導幫助生成困難任務的可靠監督軌跡,RCRL則為常規rollout全部失敗的任務恢復學習信號。

從評測診斷走向持續演進

AgentOmnia利用Diagnose Agent從評測結果中自動抽取Product Requirements Documents(PRDs),明確目標場景、能力缺口、環境語義、任務結構、合成約束和驗收條件,從而指導下一輪環境、任務和軌跡合成。另一方面,PRD作為AgentOmnia的自演進數據協議,還可以高效連接業務需求與模型研發,產品經理或業務人員撰寫PRD即可直接引導后續的數據合成與模型演進。

依據OmniaBench診斷結果構建121個環境和804個任務,進行小規模的自演進技術驗證。完成一輪增量訓練后,OmniaBench挑戰集由37.11%提升至38.49%,三項外部基準宏平均由43.22%提升至44.14%,初步證明了技術的有效性和泛化性。

PRD引導的模型持續演進閉環。 評測失敗被聚合為能力診斷,并轉化為包含環境、任務、驗證和數據優先級要求的PRD,進一步指導下一輪數據合成與模型后訓練。

團隊后續將嘗試在性能更強的新一代基礎模型上驗證這一體系,擴大數據合成與診斷規模,開展多輪自演進的實驗。同時也將探索如何從產品文檔、業務需求和代表性用戶Query出發,構建更貼近真實產品運行條件的環境和任務,在華為云智果AgentArts、OfficeAce辦公智能體等核心產品場景中完成后訓練技術能力的遷移應用。

星空人工智能技術網 倡導尊重與保護知識產權。如發現本站文章存在版權等問題,煩請30天內提供版權疑問、身份證明、版權證明、聯系方式等發郵件至1851688011@qq.com我們將及時溝通與處理。!:首頁 > 星空人工智能產業 > AI大模型 » AgentOmnia:面向全場景能力擴展的Agent大模型后訓練技術實踐

感覺不錯,很贊哦! ()
分享到:

相關推薦

留言與評論(共有 0 條評論)
   
驗證碼: