深度分析
ParaGUIBench:首個多GUI代理平行執行與協作基準測試
GUI 代理在長時間任務上因序列化循環而效率低落。ParaGUIBench 是首個專為多代理平行執行設計的基準,含 233 項任務與效率指標。其 ParaGUI 規劃器-工作者架構將任務分解並分配給並行工作者,成功率達 46.4%,比最強序列基線高 12.9 個百分點,步驟與代幣用量減半。
深度分析
AIR-BENCH Live 是 AIR-BENCH 2024 的自我演進版本,旨在解決靜態安全評測基準無法跟上快速變化的AI法規與模型能力的問題。該系統透過自動化管道監控政府法規,並以分層分類器將新政策匹配至現有風險分類或提出新類別。
深度分析
大型語言模型(LLM)的預訓練資料品質至關重要,但現有篩選流程(如 FineWeb-Edu、DCLM)過度專注單一品質指標,導致資料分布狹窄、長尾知識流失。為解決此問題,研究團隊提出 CuraWeb 框架,將傳統線性篩選轉為品質、冗餘度與多樣性的聯合最佳化。
深度分析
傳統文件分類對所有文件投入相同運算資源,效率不彰。DocHRL 以階層式強化學習動態選擇每個文件最經濟的分類路徑,獎勵函數納入推論、誤分類與人工審查成本。在 RVL-CDIP 基準上以更低成本達到 macro F1 0.973,較固定分類器成本降低 69%,準確率提升 6 個百分點。
深度分析
Text-to-SQL 常因 Schema Linking 階段精確度與召回率失衡而影響準確率。CHS-SQL 提出基於小型語言模型的新框架,透過波束搜尋與模型內部信心度機制,可量化調整兩者平衡,在 SPIDER 與 BIRD 基準測試中以單張 RTX 4090 創下 SOTA 成績。
深度分析
現有目標導向對話系統多專注於完成單一明確目標,但電話助理需同時協調裝置擁有者的明確預設目標與來電者的隱含動態目標。
深度分析
大型語言模型(LLM)的後訓練階段,特別是基於強化學習(RL)的流程,通常會將 Rollout(生成軌跡)與 Training(訓練)分離到不同 GPU 上執行。然而,Rollout 的延遲常因提示複雜度而出現長尾分布,導致下游 Training 的 GPU 閒置,形成管線氣泡。
速報
一項來自 ArXiv 的研究探討大型語言模型(LLM)能否作為動態熱環境的控制器。研究人員測試了五種不同規模的 LLM,包括 Qwen-3~14B 與 GPT-4o,評估它們在遵循設定點、解讀自然語言指令、推理致動器效果以及整合物理模型知識等方面的表現。
深度分析
視覺語言模型(VLM)在分析圖表時,容易受到軸線截斷、反轉、比例扭曲、色彩誤導等欺騙性設計影響,導致錯誤解讀。為系統性評估此漏洞,研究團隊提出 VisDeception 基準,包含 1,600 組配對圖表(忠實 vs 誤導),涵蓋八類欺騙策略。他們並引入「欺騙分數」指標,區分因欺騙導致的錯誤與一般圖表理解錯誤。
速報
大型語言模型與自動編碼代理被用來進行平行程式碼的跨 API 遷移,但缺乏可靠驗證方法。ParBench 以計算核心為中心,透過宣告式規範固定基礎設施,評估 LLM 在 CUDA、OpenMP 等 API 間的翻譯能力。初步結果顯示,現有模型在方向對稱性與多檔案協調上仍有顯著障礙。
深度分析
本研究探討了提示詞(prompt)中的關鍵字選擇如何影響在手機等邊緣裝置上運行的大型語言模型(LLM)的能源消耗。研究團隊透過在智慧型手機上進行實際功率測量,量化了不同動詞和指令結構對解碼長度及總能耗的影響。
深度分析
本論文提出一個基於執行證據的紅隊測試框架,專門用於評估系統維運中程式代理的安全性。研究團隊發現,直接要求代理執行危險操作(如修改系統啟動腳本)時,代理通常會拒絕;但若將相同操作包裝在看似正常的軟體工程任務(如單元測試、回歸測試、錯誤重現)中,代理往往會接受並執行,導致系統遭受持久且不可逆的損害。
現有工業代理人基準測試(如 AssetOpsBench)依賴手動撰寫場景,涵蓋資產類別有限。研究團隊以智慧電網變壓器為新資產類別,整合 IEC 標準的四項診斷工具(健康指數預測、溶解氣體分析、繞組溫度評估、負載輪廓評估),並提出 ScenarioGeneratorAgent 合成場景生成管線。
大型語言模型(LLM)作為自動化評審(LLM-as-a-judge)雖已成為業界標準,但其高昂的 API 成本、緩慢的推論速度以及不透明的決策過程,嚴重限制了可擴展性與可靠性。
小型語言模型(SLM)在資源受限環境中部署時,面臨持續學習(CL)的挑戰,因參數空間有限,直接更新容易導致災難性遺忘。現有針對大型語言模型(LLM)的記憶式方法依賴大量儲存與上下文推理能力,不適合 SLM。
本研究提出 DeepLens 診斷代理人,一個五階段的代理管線,以 JSL Medical Small 7B v2 模型為核心,搭配檢索增強生成(RAG)。該管線強制執行結構化臨床萃取、嚴謹檢索、約束候選生成、明確證據三角驗證及可稽核的最終決策。
WaveXisMCP 是純 Python 的 MCP 伺服器,提供 220 個瀏覽器自動化工具與 13 層能力分級。它無需 Node.js,直接啟動現有 Chrome 或 Edge,支援 CDP 與 BiDi 雙後端。結構化錯誤回饋讓 LLM 能自我修正,為 AI 代理的瀏覽器控制開創新選項。
Crisphive 推出官方 MCP 伺服器,讓 Claude、ChatGPT、Gemini 等 AI 代理能直接對接現場服務排程系統。透過 Model Context Protocol,AI 可根據技術人員的位置、技能與即時可用性,自動媒合客戶預約、開立工單、派遣人員與管理車隊。
GitHub 上出現了一個名為 slides_maker 的新開源專案,它並非單純的提示詞生成工具,而是由一組專門的 AI 代理協作,從讀取論文、程式碼或文件開始,規劃簡報架構、設計投影片,最後產出原生的 PowerPoint 檔案。該專案強調資料來源可追溯,不憑空捏造數字,且所有圖表、文字框和方程式都是可點擊編輯的物件,而非圖片。
Anthropic 官方 Claude in Chrome 擴充套件內建 58 個封鎖網域,限制 AI 代理的行動範圍。開源專案 Open Claude in Chrome 透過逆向工程移除所有限制,支援所有 Chromium 瀏覽器,保留完整 18 個 MCP 工具與相同效能,為開發者提供更自由的瀏覽器自動化解決方案。
GitHub 上出現一款名為 ego-lite 的新開源瀏覽器,專為 AI 代理設計,主打極速瀏覽器自動化。它讓開發者與 AI 代理能同時在瀏覽器中工作,代理在獨立空間執行任務,不會干擾使用者的分頁。有別於 browser-use 等傳統框架,ego-lite 原生支援共享登入狀態與分頁,無需額外設定。
TanStack 團隊正式釋出名為「ai」的 TypeScript AI SDK,主打型別安全(type-safe)與供應商無關(provider-agnostic),支援 OpenAI、Anthropic、Gemini 等多模型,並能無縫整合 React、Vue、Svelte、Solid 等前端框架。