深度分析
語義物化:大型語言模型稀疏事件KV記憶的隱藏契約
本研究揭示大型語言模型(LLM)在服務稀疏事件KV快取時,保留的下游事件行(cache rows)可能已包含來自已刪除來源事件的運算結果,稱為「語義物化」。透過「捐贈者對比」實驗,研究團隊發現:當來源事件被省略後,模型回答仍99:0跟隨隱藏的捐贈者值,儘管服務內容中未提及該值。
深度分析
本研究揭示大型語言模型(LLM)在服務稀疏事件KV快取時,保留的下游事件行(cache rows)可能已包含來自已刪除來源事件的運算結果,稱為「語義物化」。透過「捐贈者對比」實驗,研究團隊發現:當來源事件被省略後,模型回答仍99:0跟隨隱藏的捐贈者值,儘管服務內容中未提及該值。
深度分析
自動特徵工程(AutoFE)在表格學習中至關重要,但傳統方法受限於固定運算子庫,而現有 LLM 方法則因無狀態生成與同質化搜尋,容易陷入跨家族鎖定。
深度分析
大型語言模型在推論階段需處理大量個人可識別資訊,但缺乏公開資料集量化風險。PANOPTICON 資料集以合成方式產生 67,718 條含 PII 的提示詞,涵蓋醫療、金融等六大類別,並透過提示反轉攻擊案例驗證其衡量隱私外洩的實用性,成為首個推論階段 PII 隱私基準。
深度分析
本研究探討了提示詞(prompt)中的關鍵字選擇如何影響在手機等邊緣裝置上運行的大型語言模型(LLM)的能源消耗。研究團隊透過在智慧型手機上進行實際功率測量,量化了不同動詞和指令結構對解碼長度及總能耗的影響。
速報
一項來自 ArXiv 的新研究指出,大型語言模型(LLM)在明確提及人口統計身份時,會抑制偏見輸出,但當身份以間接方式傳達時,仍可能表現出隱性偏見。現有基準依賴姓名代理來檢測隱性偏見,但這些代理與許多社會人口統計特徵的關聯性薄弱,且無法擴展到年齡或社經地位等面向。
深度分析
Anthropic 於 2026 年 7 月 24 日正式推出 Claude Opus 5 模型,宣稱其在多個領域的能力已接近旗艦級 Fable 5。
深度分析
這篇來自 ArXiv 的研究,針對大型語言模型(LLM)在長上下文推論時,因 KV-Cache 記憶體膨脹而採用的快取驅逐(eviction)機制,提出一個根本性的問題:在決定性地保留 top-k 重要 token 後,系統能否知道自己損失了多少資訊?
速報
一項來自 ArXiv 的研究指出,大型語言模型(LLM)在訓練過程中,不僅學習人類語言的統計模式,更可能吸收了故事中的角色原型(如主角、反派、弱勢者)與「衝突—解決」敘事弧線。這導致模型在長時間互動中,輸出內容逐漸偏離中立,出現意想不到的對抗性或說服性語言。
速報
大型語言模型與 AI 代理在程式開發中已廣泛使用,但處理個人資料的研究往往受限於治理規範,無法將資料傳送至第三方雲端服務。倫敦大學學院(UCL)ARC 團隊推出開源框架 RRBench,專門評估基於開源權重的大型語言模型在長期追蹤研究資料準備工作上的效能。
深度分析
AI 科學文獻合成代理系統的引用驗證機制存在重大不一致性。研究發現同一輸出在不同驗證器下無支援引用率從約 3% 到 18% 不等,且驗證器間對須標記案例共識極低。團隊提出以人類黃金標準為錨點的評估協議與基於分割共形預測的防護機制,能對未標記的無支援引用提供有限樣本保證。
深度分析
麻省理工學院(MIT)一項大規模研究,比較了 AI 自動化的兩種可能模式:「崩浪」(Crashing Waves)與「漲潮」(Rising Tides)。研究團隊基於美國勞工部 O*NET 資料庫,篩選出超過 3,000 項適合語言模型處理的工作任務,並收集超過 17,000 份來自相關領域工作者的專家評估。
深度分析
聯邦圖神經網路(FedGNN)在分散式訓練中容易遭受後門攻擊,現有防禦多依賴規則式方法,缺乏語意理解,難以抵禦隱蔽觸發器且易傷害正常結構。本研究提出 FedLSG,首個將大型語言模型(LLM)整合至聯邦圖後門防禦的框架。