AMD e Cerebras: Nuova Soluzione Disaggregata per l’Inferenza AI
AMD e Cerebras annunciano una partnership per una soluzione disaggregata per l'inferenza AI, combinando Helios e Wafer-Scale Engine.
In Breve
- Qual è la novità annunciata da AMD e Cerebras?
- Hanno lanciato una soluzione disaggregata per l'inferenza AI combinando Helios e Wafer-Scale Engine.
- Quando sarà disponibile la nuova soluzione?
- La soluzione sarà disponibile tramite Cerebras Cloud nella seconda metà del 2026.
- Qual è il vantaggio principale di questa architettura?
- Permette un incremento fino a cinque volte dei token per secondo per watt rispetto a configurazioni precedenti.
AMD e Cerebras Systems hanno recentemente annunciato una partnership tecnica che promette di rivoluzionare il campo dell’intelligenza artificiale (AI) attraverso una soluzione disaggregata per l’inferenza. Questa innovativa combinazione del rackscale Helios di AMD e del Wafer-Scale Engine (WSE) di Cerebras sarà disponibile tramite Cerebras Cloud nella seconda metà del 2026.
Durante i test interni, le due aziende hanno registrato un incremento fino a cinque volte dei token per secondo per watt (TPS/W) rispetto a una configurazione WSE standalone, utilizzando l’open-source Kimi 2.6 1T come riferimento. Questa architettura avanzata sposta la fase di prefill e l’elaborazione dei prompt sul rack Helios, compensando le minori efficienze del WSE in quella fase del flusso di lavoro, mentre il WSE si concentra sul decode e sulla generazione dei token.
Il modello Kimi 2.6, oggetto del confronto, è un modello mixture-of-experts con un trilione di parametri totali, ma solo circa 32 miliardi attivi per token e un peso complessivo in INT4 di circa 500 GB. Un singolo wafer Cerebras contiene 44 GB, il che implica che un’implementazione esclusivamente WSE richiederebbe oltre una dozzina di wafer. Al contrario, un rack Helios è in grado di ospitare il modello molte volte, rendendo questo miglioramento particolarmente significativo per modelli che non possono risiedere interamente su pochi wafer WSE.
Questa innovazione potrebbe aprire la strada a modelli più densi e compatti, ma è necessario effettuare ulteriori test comparativi, specialmente rispetto alle offerte rackscale di altri fornitori. Non sono stati divulgati i termini finanziari dell’accordo, ma la notizia arriva in un contesto di crescente attenzione da parte degli investitori e del mercato sul finanziamento circolare nel settore dell’AI.
Inoltre, il movimento di AMD e Cerebras si inserisce in un periodo in cui Nvidia ha recentemente concordato una licenza non esclusiva per la tecnologia di SRAM decode di Groq, valutata 20 miliardi di dollari. Nel frattempo, Cerebras, che è stata quotata a maggio, ha registrato oscillazioni significative del suo titolo, mentre AMD continua a mantenere rialzi rilevanti del valore azionario year-to-date.
