深度分析
WaveformQA 評測登場:評估 LLM 在數位波形時序推理的極限
LLM 在程式碼生成表現優異,但對數位波形的時序推理能力仍未被充分探索。WaveformQA 基準包含 360 個問題,涵蓋多訊號關聯與事件排序。結果顯示事件時間 JSON 格式比 VCD 格式提升 37-53% 準確率,但模型在複雜時序問題上仍受限於上下文視窗與推理瓶頸。
深度分析
LLM 在程式碼生成表現優異,但對數位波形的時序推理能力仍未被充分探索。WaveformQA 基準包含 360 個問題,涵蓋多訊號關聯與事件排序。結果顯示事件時間 JSON 格式比 VCD 格式提升 37-53% 準確率,但模型在複雜時序問題上仍受限於上下文視窗與推理瓶頸。
速報
現有研究多限於孤立任務,FluxBench則系統評測AI代理在完整晶片設計流程(RTL到GDS)的表現,涵蓋開源與商用工具,並提出TokenROI成本指標。結果顯示代理系統架構性能差距達86.27%,Token ROI差異達105.92倍,凸顯系統設計與基礎模型同為關鍵。
深度分析
晶片前端自動化複雜且步驟繁多,Lego 將流程拆成六個步驟並以可插拔的電路技能標準化每項能力。團隊從多個開源專案萃取四十二項執行技能,並用自動化工具與輕量檢索加速重用。實驗在 41 個困難 RTL 任務上,模組化技能將單次成功率提升到 0.805,展現模組組合對實務自動化的價值。