Guida originale di Alex Chen (@nocodealex)

Il cubetto di feltro arancione
Guida · DeepSeek · DeepGEMM

DeepGEMM, il motore gratuito che abbatte i prezzi dell'AI

Ogni risposta di un modello AI sono milioni di moltiplicazioni su una scheda grafica. Se fai quella matematica più in fretta sullo stesso hardware, ogni risposta costa meno da servire. Questo fa DeepGEMM: la libreria kernel di DeepSeek, lo stesso codice su cui addestra e fa girare i suoi modelli, rilasciata gratis e open source.

4minuti di lettura 2prompt da copiare 4sezioni

Cos'è DeepGEMM

  1. Una libreria della matematica di base che ogni modello linguistico esegue, scritta per le GPU NVIDIA da data center più recenti (architettura Hopper SM90 e Blackwell SM100).
  2. Veloce: DeepSeek riporta fino a 1.550 TFLOPS su una singola H800, alla pari o meglio delle librerie ottimizzate a mano dagli esperti.
  3. Aggiornata: DeepSeek continua ad aggiungere i kernel dei suoi modelli più recenti, e il 30 settembre 2026 ha rilasciato una versione anche per i chip Ascend di Huawei.
  4. Gratuita: licenza MIT, quindi chiunque può usarla, modificarla e redistribuirla. Repository: github.com/deepseek-ai/DeepGEMM
Il motore a ingranaggi di feltro, dalla scena del video

Perché più veloce vuol dire più economico

  1. Una GPU costa uguale all'ora, che risponda a dieci domande o a mille.
  2. Kernel più veloci vuol dire più risposte al secondo dalla stessa GPU.
  3. Più risposte per ora di GPU vuol dire che ogni singola risposta costa meno da servire.
  4. Servire a meno e una grossa parte del motivo per cui un laboratorio può far pagare una frazione di quello che chiedono gli altri.

Lo vedi nei prezzi, per milione di token in uscita

ModelloPrezzo output / MTok
DeepSeek V4-Pro$3,96 di punta, $1,98 fuori punta
Claude Haiku 4.5$5
Claude Sonnet 5.5$10
Claude Opus 5.5$20
Claude Fable 5.1$50

Cosa vuol dire quel divario

Da $50 a $3,96 è un taglio del 92%. Non è solo il software: i modelli sono diversi, l'architettura MoE di DeepSeek attiva meno parametri per risposta, e i costi del lavoro in Cina sono più bassi. Ma il kernel veloce è uno dei pezzi grossi del puzzle.

Puoi usarlo tu?

Solo se fai girare modelli sulle tue GPU NVIDIA da data center. DeepGEMM serve a chi addestra o serve modelli, non a chi ci chatta. Ti servono:

Nel terminaleClona e installa DeepGEMM
git clone --recursive https://github.com/deepseek-ai/DeepGEMM.git
cd DeepGEMM
./install.sh

Poi fai import deep_gemm nel tuo progetto Python. I kernel si compilano al primo utilizzo, quindi non c'è una compilazione lunga da aspettare.

Se sei in Italia

Non cambia niente dal punto di vista tecnico: DeepGEMM gira ovunque ci sia la GPU giusta. Il punto è che queste GPU (H100, H800) costano migliaia di euro e stanno nei data center, non sotto la scrivania. Se non gestisci infrastruttura di questo tipo, la sezione qui sotto è quella che ti riguarda.

Niente GPU? Ecco cosa cambia per te

  • I modelli economici continuano a diventare più economici perché la matematica sotto diventa più veloce. Librerie come questa sono il motivo.
  • Non tutti i lavori hanno bisogno del modello più costoso. Manda il lavoro facile e ripetitivo (ordinare, etichettare, prime bozze) a un modello più economico e tieni Opus per il ragionamento difficile.
  • Ricontrolla i prezzi ogni paio di mesi. Il divario tra i modelli si muove in fretta.
Il cubetto di feltro che stampa foglietti, dalla scena del video
Incolla in ClaudeScopri dove puoi risparmiare sui tuoi lavori AI
Ecco la lista dei lavori AI che faccio ogni settimana: [incolla i tuoi]. Dividili in lavori che hanno bisogno del modello migliore e lavori che un modello più economico potrebbe gestire, e stima quanto risparmierei al mese spostando quelli facili.
Salvalae girala

Tienila per la prossima volta che guardi la bolletta dell'AI, e mandala a quell'amico che manda tutto a Opus.