速報
ParBench 登場:AI 寫平行程式到底行不行?新基準測試一測便知
大型語言模型與自動編碼代理被用來進行平行程式碼的跨 API 遷移,但缺乏可靠驗證方法。ParBench 以計算核心為中心,透過宣告式規範固定基礎設施,評估 LLM 在 CUDA、OpenMP 等 API 間的翻譯能力。初步結果顯示,現有模型在方向對稱性與多檔案協調上仍有顯著障礙。
速報
大型語言模型與自動編碼代理被用來進行平行程式碼的跨 API 遷移,但缺乏可靠驗證方法。ParBench 以計算核心為中心,透過宣告式規範固定基礎設施,評估 LLM 在 CUDA、OpenMP 等 API 間的翻譯能力。初步結果顯示,現有模型在方向對稱性與多檔案協調上仍有顯著障礙。
NVIDIA Agent Skills
NVIDIA 推出官方驗證的 Agent Skills,讓 Claude Code 與 Codex 等 AI 代理能直接執行物理 AI、CUDA 與機器人模擬工作流程。該專案以 Apache-2.0 開源,提供一鍵安裝指令,並透過自動同步管道持續更新。此舉有望降低 NVIDIA 軟體的學習門檻,並推動 AI 代理技能標準化。
Rust
隨著大型語言模型需求激增,openinfer以純Rust與CUDA實作LLM推論引擎,拋棄PyTorch與框架跑時,支援Qwen3至兆參數Kimi‑K2,展現與主流開源推論框架相當的效能與可擴展性。完全使用Rust編寫,所有CUDA kernel與排程自行手寫,提供企業級部署的可行方案。
深度分析
Nvidia於台北電腦展推出RTX Spark超級晶片,具1petaflop計算力,支援AI代理與本地大模型。多家PC代工將於秋季推出搭載此晶片的Windows電腦,並內建與微軟共同開發的安全沙盒。此舉預示AIPC市場可能快速成長,同時挑戰傳統GPU為主的AI生態。
RTP-LLM
報導聚焦一款來自企業團隊的開源推理引擎,背景為大型語言模型在生產場景需求快速成長。核心透過圖形運算處理器加速、分頁注意力與高效解碼等演算法優化,並結合權重整數量化、KV快取量化與預填與解碼分離的系統設計。結果在降低推理延遲與提升生產環境吞吐及部署穩定性方面有明顯助益。
深度分析
Nvidia透過CUDA建立AI軟體護城河,利用平行化讓GPU效能大幅提升;同時AMD、Intel的ROCm與OneAPI仍受限於生態鎖定。此格局影響未來AI開發成本與生態多樣性。在深度學習訓練與資料生成階段,CUDA的並行運算與專屬庫讓Nvidia GPU效率領先,同時VUDA的跨庫共享技術展示出新一代資源整合可能。
深度分析
具身人工智慧模擬同時依賴 CUDA 物理運算與 Vulkan 光線渲染,但兩者在 GPU 軟體堆疊上被時間片隔離,導致資源階段性閒置。
深度分析
本教學示範在GoogleColab內安裝PrismML的llama.cppCUDA二進位檔,下載Bonsai-1.7BGGUF模型,說明Q1_0_g1281-bit量化原理、記憶體縮減與效能基準,並展示聊天、JSON、程式碼產生及OpenAI兼容伺服器等實作流程。