gpt-oss-120b gira su un Galaxy S24+ e cinque computer, a 1,1 token al secondo

Un utente Reddit ha distribuito i layer di gpt-oss-120b quantizzato a 4 bit su sei dispositivi, fra cui un Galaxy S24+, un mini PC con RTX 3060 e tre Mac, con il parallelismo di pipeline. Funziona, ma genera appena 1,1 token al secondo.

Sett 29, 2026 - 11:31
 0  0
gpt-oss-120b gira su un Galaxy S24+ e cinque computer, a 1,1 token al secondo
Un utente Reddit ha distribuito i layer di gpt-oss-120b quantizzato a 4 bit su sei dispositivi, fra cui un Galaxy S24+, un mini PC con RTX 3060 e tre Mac, con il parallelismo di pipeline. Funziona, ma genera appena 1,1 token al secondo.
Hardware Upgrade Le News di Hardware Upgrade sulla tecnologia e sul mondo informatico - https://www.hwupgrade.it

Questo sito utilizza i cookie. Continuando a navigare nel sito accetterai l'uso dei cookie.