商傳媒|林昭衡/綜合外電報導
專注於提升人工智慧(AI)工作負載穩定性的公司 Clockwork.io,於本週一(10月5日)宣布成功募得 3100 萬美元(約新台幣 10 億元)的新一輪資金。這筆資金由 Premji Invest、Wing Venture Capital 和 Seligman Ventures 共同領投,既有投資者恩頤投資(NEA)和阿聯酋電信(e& Capital)也參與其中。
隨著此次募資,Clockwork.io 的總募資額已達 7300 萬美元。該公司表示,這筆資金將用於擴大其故障容錯軟體的部署範圍,涵蓋 AI 模型訓練、推論(Inference)以及強化學習等各種人工智慧運算任務(AI workloads),這些任務需要大量運算資源,穩定性至關重要。此外,Clockwork.io 也計畫透過雲端夥伴,推動其企業解決方案的市場普及與分銷。
AI 運算往往依賴大量伺服器與繪圖處理器(GPU)協同工作,其中任何一個環節的硬體故障,都可能導致整個 AI 任務中斷,被迫重新啟動,耗費大量時間與資源。為解決這類硬體失效對 AI 運算影響的技術細節問題,Clockwork.io 推出了創新的軟體解決方案。其 LinkPass 技術能在網路連線失敗時,自動將流量導向健康的網路介面,確保分散式 AI 任務能持續運行而無需重啟。而 TorchPass 技術則能將受影響的工作轉移到備用資源,支援計畫性維護、預警式故障,乃至於部分突發性故障的處理。
領英(LinkedIn)已在其 AI 基礎設施中部署了 LinkPass。根據領英基礎設施主管 Raghu Hiremagalur 的說法,這項技術每月避免了數萬 GPU 小時的停機時間。AI 新創公司 Together AI 也將 TorchPass 作為一項服務引進其 GPU 叢集。現有客戶 WhiteFiber 則擴大了對 Clockwork 軟體的使用,用於 GPU 服務營運,並透過自動化稽核提前發現潛在的硬體問題。
Clockwork.io 指出,他們的 TorchPass 快照功能能在不改變訓練程式碼的情況下,捕捉分散式訓練任務的運行狀態和 GPU 記憶體狀態,以便在有兼容資源時隨時恢復任務。內部測試顯示,在八個 H200 節點配置上使用 Megatron-LM 模型進行快照,總暫停時間不到 20 秒。該公司強調,若這些部署成功,客戶將能以更少的干擾性重啟和重複運算完成任務,平台團隊也能在維護或重新分配資源時獲得更大的彈性。







