AI 代理人評測再進化:ScenarioGeneratorAgent 用合成場景加速工業基準測試
現有工業代理人基準測試(如 AssetOpsBench)依賴手動撰寫場景,涵蓋資產類別有限。研究團隊以智慧電網變壓器為新資產類別,整合 IEC 標準的四項診斷工具(健康指數預測、溶解氣體分析、繞組溫度評估、負載輪廓評估),並提出 ScenarioGeneratorAgent 合成場景生成管線。
工業代理人(Industrial Agent)的評測需要結合遙測數據、故障模式、維護記錄與領域標準的真實場景,但現有基準測試如 AssetOpsBench 仍高度依賴人工撰寫,且涵蓋的資產類別相當有限。
延伸 AssetOpsBench:智慧電網變壓器與 IEC 診斷工具
研究團隊以智慧電網變壓器(Smart Grid Transformer)作為新的資產類別,並整合四項 IEC 標準診斷工具:健康指數預測、溶解氣體分析、繞組溫度評估、負載輪廓評估,讓代理人能在更貼近實務的條件下進行測試。
ScenarioGeneratorAgent:合成場景生成管線
為解決手動場景生成效率低落的問題,團隊提出了 ScenarioGeneratorAgent。這套管線會先建構以證據為基礎的資產輪廓,再跨營運領域分配覆蓋率感知的場景預算,最後透過混合驗證與修復迴圈產生候選場景。該迴圈會檢查模式有效性、工具可達性、物理合理性、標準一致性,並排除重複項目。
最佳化策略:8 倍加速、品質不降
為了提升擴展性,管線導入兩層快取、平行焦點群組生成、執行緒池卸載、批次 LLM 呼叫,以及早期拒絕過濾。在智慧電網變壓器場景生成任務中,這些最佳化讓 50 個場景的端到端執行時間從未最佳化的基準線縮短 8 倍,同時品質分數維持在 74.2±1.9(基準線為 73.8±3.0)。
結論
這項研究證明,基於標準的合成場景生成能有效擴展工業代理人基準測試,且不犧牲場景品質。未來這類方法可望加速工業 AI 代理人的開發與驗證流程。
延伸閱讀
- Patch2Vuln:以語言模型結合 Ghidra/Ghidriff 從 Linux 二進位重建補丁語意
- SAFE:以 LLM 情境化靜態分析評估公開研究工件的安全風險
- PEB 基準:量化授權受限證據對企業代理式人工智慧結果完整性的影響
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。