NVIDIA
中小網大
章節一:能耗與平行計算新浪潮 - 解析為何運算效能受限於能耗(Performance per Watt),以及從單純追求速度轉向能效比的趨勢。
章節二:張量核心(Tensor Cores)與混合精度算力突破 - 探討 FP64、FP16 到混合精度(如 LU 分解、GMRES 迭代演練)在維持精度的同時節省數倍能耗與大幅提升效能。
章節三:核心融合(Kernel Fusion)與 JIT 即時編譯 - 介紹如何透過將多個運算步驟融合以減少資料搬移,並利用 JIT 編譯器優化動態工作流程。
章節四:Python 與 CUDA 生態系的深度結合 - 說明如何透過 CuBLASdx、Cutlass、Warp 及 Legate 將 C++ 底層極致效能轉化為 Python 開發者的完整加速體驗。
章節五:分散式系統加速與 GPU Direct 技術進化 - 剖析 GPUDirect Async 到 Kernel Initiated 如何突破 CPU 瓶頸,實現低延遲與高頻寬通訊。
章節六:Grace Hopper 架構與動態任務圖(Conditional CUDA Graphs) - 介紹統一記憶體架構(NVLink C2C)與 CUDA 12.4 具備控制流(If / While)的動態圖運算。
活動詳情:https://smelearning.sme.gov.tw/news.php?node=840