深度分析
CallBench:50,000 通對話驗證電話助理雙目標協調能力,現有方法瓶頸顯著
現有目標導向對話系統多專注於完成單一明確目標,但電話助理需同時協調裝置擁有者的明確預設目標與來電者的隱含動態目標。
深度分析
現有目標導向對話系統多專注於完成單一明確目標,但電話助理需同時協調裝置擁有者的明確預設目標與來電者的隱含動態目標。
深度分析
由Reid Hoffman與Marc Pincus共同創立的AI研究實驗室Prentis,正以10億美元估值募資1億美元。該公司訓練電腦使用模型,目標是自動化辦公室例行工作流程,已簽訂5000萬美元合約,並自稱模型成本僅為頂尖API的十分之一。
速報
一項來自 ArXiv 的研究指出,現行評估標準僅關注 AI 代理人的最終決策是否一致,卻忽略了其決策過程的穩定性。研究團隊推出 DFAH-Bench,這是一個透過重播(replay)來評估金融代理人行為穩定性的新基準。該基準從工具呼叫軌跡、證據接觸點與決策集中度三個面向,衡量代理人的行為是否一致,且無需讀取內部推理文字。
深度分析
前Google安全高層創立AegisAI,開發AI代理人技術對抗AI驅動的魚叉式釣魚攻擊。該系統模擬人類分析郵件異常,識別傳統規則無法攔截的惡意郵件與偽裝附件。成立不到一年即獲3600萬美元A輪融資,客戶涵蓋Mash、LangChain及Google旗下Lokker。
深度分析
一項針對 20 名大學生的控制實驗發現,使用通用型 AI 代理人(OpenClaw)執行日常任務時,使用者的信任並非對系統一視同仁,而是根據任務特性(隱私、風險、可逆性)逐項調校。其中,傳送電子郵件這類不可逆且對外可見的任務,觸發最顯著的信任下降(平均 3.10 分)與最高的核准需求(平均 4.65 分)。
深度分析
在RSA會展上報導指出八成五企業有AI代理人試點但僅有少數進入生產。文章強調必須建構信任架構,從身分、委派到遙測皆需同時落實;並提出Defense Claw與OpenShell整合為範例。其核心影響是若無可信委派與可觀測性,試驗難以規模化生產。