【okooo澳客官網科技消息】AI數據基礎設施公司Weka與高性能計算平臺Andromeda近日宣布達成戰略合作,Weka的NeuralMesh平臺將作為Andromeda管理型GPU集群的核心AI數據存儲層。通過專用NeuralMesh或GPU原生方式的NeuralMesh Axon部署,Andromeda的客戶可在不同超大規模計算服務商和AI云環境中獲得一致的存儲性能。
圖源網絡
Andromeda致力于讓開發前沿技術的所有團隊都能獲取高性能計算資源,使創新由想法本身而非硬件可及性驅動。該公司與主要AI研究機構、數據中心和云服務提供商合作,在全球供應鏈中分配訓練和推理工作負載。目前Andromeda已與全球50余家計算提供商建立合作,通過不斷增長的管理型集群網絡路由訓練和推理工作負載。
Andromeda平臺上的所有集群無論由哪家運營商管理,都必須滿足相同的質量標準。公司在向客戶提供服務前,會對每個集群的GPU、存儲、網絡架構和安全進行認證。在此過程中,不同供應商的存儲環境差異導致集群間性能參差不齊的問題逐漸顯現。
通過與Weka合作,Andromeda在現有硬件上實現了顯著的性能提升,可在幾分鐘內完成部署,確保所有供應商的一致性,同時降低存儲成本。Andromeda首席執行官威爾·穆謝表示,公司的目標是實現計算的全球流動,這意味著提供的每個集群無論容量來自何處都必須正常運行。通過Weka NeuralMesh實現標準化后,客戶在決定性能的存儲和內存層同時獲得了超大規模服務商級別的一致性和開放市場的靈活性。他補充道,閑置的GPU正在阻礙AI創新的速度,Weka幫助Andromeda管理的所有GPU都能充分發揮作用。
NeuralMesh Axon是NeuralMesh軟件平臺的GPU原生部署方式,將存儲直接集成到Andromeda的GPU服務器中,通過將集群現有的NVMe轉換為統一的高性能數據層,以最高速度為訓練和推理供應數據。由于該基礎設施已安裝在機架中并通電運行,成本也已支付,因此可在不增加額外空間、電力消耗和費用的情況下僅提升性能。
借助NeuralMesh Kubernetes Operator,Andromeda可在幾分鐘內構建完整的NeuralMesh集群,并通過管理堆棧其他所有層的相同工作流管理整個集群網絡。Andromeda的NeuralMesh部署中約一半采用NeuralMesh Axon方式運營,另一半則為需要將所有GPU核心和每GB內存專用于自身工作負載的客戶提供專用NeuralMesh部署。無論部署位置如何,NeuralMesh都能為底層任何供應商的硬件提供相同的性能標準。這種可靠性使Andromeda能夠將客戶接入此前沒有共享存儲的集群。
合作帶來的實際效果已經顯現。新的NeuralMesh Axon集群可在最短10分鐘內完成部署,AI團隊從集群上線當天即可運行工作負載。環境啟動加載時間從3分鐘縮短至30秒,使AI團隊每天能夠進行更多實驗。采用NeuralMesh Axon運營的Andromeda集群實現了每集群每秒超過400GB的持續吞吐量和實際運營環境中每秒超過600萬IOPS的性能。得益于此,Andromeda的一家生物技術客戶可在幾分鐘而非幾小時內完成涉及每目錄10億文件的元數據密集型傳輸任務。當集群存在故障擴散風險時,NeuralMesh能夠阻斷故障傳播,維持集群可用性,保護所有客戶的工作負載。
版權所有,未經許可不得轉載
-okooo澳客官網