
Together.ai 引入了一種用於加速擴散變壓器的新方法——Chipmunk,承諾在影片和影像生成中提供顯著的速度改進。據 Together.ai 稱,該方法利用動態列稀疏增量且無需額外訓練。
動態稀疏性以實現更快處理
Chipmunk 採用一種技術,通過對先前步驟中快取的注意力權重和 MLP 啟用進行動態計算稀疏增量。這種方法使 Chipmunk 在像 HunyuanVideo 這樣的平臺上比傳統方法快達3.7倍的影片生成。在特定配置中顯示了2.16倍的速度提升,並在 FLUX.1-dev 上生成影像的速度高達1.6倍的加速。
解決擴散變壓器的挑戰
擴散變壓器(DiTs)廣泛用於影片生成,但其高時間和成本需求限制了其可及性。Chipmunk 通過關注兩個關鍵見解來解決這些挑戰:模型啟用的緩慢變化特性和其固有的稀疏性。通過重新制定這些啟用以計算跨步增量,該方法提高了它們的稀疏性和效率。
硬體感知最佳化
Chipmunk 的設計包括一種硬體感知的稀疏模式,利用非連續列在全域性記憶體中最佳化為密集的共享記憶體塊。此方法結合快速核心,實現了顯著的計算效率和速度改進。該方法利用 GPU 偏向於處理大塊的特點,與原生塊大小一致以實現最佳化效能。
核心最佳化
為了進一步提升效能,Chipmunk 集成了多項核心最佳化。這些最佳化包括通過自定義 CUDA 核心實現的快速稀疏識別、使用 CUDA 驅動程式 API 的高效快取回寫以及專門的持久核心。這些創新使執行更加高效,減少了計算時間和資源使用。
開源和社群參與
Together.ai 通過在 GitHub 上釋出 Chipmunk 的資源,積極擁抱開源社群,邀請開發者探索和利用這些進展。這一舉措是加速 FLUX-1.dev 和 DeepSeek R1 等各種架構模型效能的更廣泛努力的一部分。
欲瞭解更多詳細洞察和技術文件,感興趣的讀者可以訪問 Together.ai 的完整部落格文章。
Image source: Shutterstock