Scenario e contesto

L’intelligenza artificiale non vive più solo nel cloud

Per molto tempo abbiamo associato l’intelligenza artificiale avanzata a un’idea precisa: grandi modelli ospitati su server remoti, accesso tramite API, costi a consumo e dati inviati verso piattaforme esterne.

È stato, ed è ancora, il modello dominante.

ChatGPT, Gemini, Claude e altri sistemi cloud hanno portato l’AI nelle aziende, negli studi professionali, negli uffici marketing, nei reparti tecnici e nella produzione di contenuti. Il vantaggio è evidente: potenza immediata, aggiornamenti continui, accesso semplice e nessuna necessità di gestire infrastrutture locali complesse.

Ma questo modello ha anche alcuni limiti.

Quando un’azienda lavora con dati riservati, documenti interni, procedure operative, contratti, atti, cartelle cliniche, fatture, report finanziari o codice proprietario, il tema non è più solo “quanto è potente il modello”. Diventa importante anche capire dove girano i dati, chi li controlla, quanto costa ogni interrogazione, quanto è personalizzabile il sistema e quanto si può integrare davvero nei processi quotidiani.

È qui che entra in gioco l’AI locale.

Non come sostituzione totale del cloud, ma come seconda architettura possibile.

Una macchina dedicata, installata in azienda o in studio, con una buona CPU, una GPU adeguata, RAM sufficiente e storage veloce, può diventare un vero ambiente AI privato. Un ambiente dove eseguire modelli locali, costruire RAG, indicizzare documenti, sviluppare agenti specializzati e creare applicazioni verticali su misura.

In questo scenario, Gemma 4 di Google DeepMind è interessante perché rappresenta un passo ulteriore verso modelli più efficienti, utilizzabili non solo su server, ma anche su workstation, laptop evoluti e dispositivi locali.

Che cos’è Gemma 4

Gemma 4 è una famiglia di modelli open-weight sviluppata da Google DeepMind. Non va confusa con Gemini, che è la famiglia di modelli proprietari e cloud di Google.

La differenza è importante.

Gemini è pensato principalmente per essere utilizzato attraverso servizi Google, API e piattaforme cloud. Gemma, invece, nasce come famiglia di modelli aperti nei pesi, scaricabili e utilizzabili dagli sviluppatori in ambienti locali o personalizzati.

Questo significa che un’azienda, uno sviluppatore o un consulente possono prendere un modello Gemma, eseguirlo su hardware proprio, integrarlo in un’applicazione, collegarlo a documenti locali, usarlo per creare agenti o inserirlo dentro un flusso software esistente.

Gemma 4 introduce diverse caratteristiche rilevanti:

  • supporto multimodale per testo e immagini, con audio disponibile su alcuni modelli;
  • inestre di contesto molto lunghe, fino a 128K o 256K token a seconda della versione;
  • miglioramento delle capacità di ragionamento;
  • supporto al coding;
  • funzionalità orientate agli agenti;
  • supporto nativo al system prompt;
  • possibilità di function calling;
  • disponibilità in diverse dimensioni, così da adattarsi a hardware e scenari differenti.

Il punto non è dire che Gemma 4 sia automaticamente “meglio” dei modelli cloud più potenti. Sarebbe una semplificazione.
Il punto è che modelli di questo tipo rendono più concreta una nuova architettura: quella dell’AI locale, privata, personalizzabile e integrata nei processi aziendali.

Perché l’AI locale interessa davvero alle aziende

Quando si parla di AI locale, spesso si cade in due estremi. Da una parte c’è chi pensa che basti installare un modello sul PC per avere una specie di ChatGPT privato equivalente ai migliori sistemi cloud. Non è così. I modelli locali, soprattutto se piccoli o quantizzati, possono avere limiti importanti in termini di ragionamento, accuratezza, velocità e affidabilità.

Dall’altra parte c’è chi considera l’AI locale solo un esperimento da appassionati o sviluppatori. Anche questa visione è ormai riduttiva.

Implicazioni operative

L’AI locale è interessante non perché faccia tutto meglio del cloud, ma perché risolve problemi diversi.

Il primo problema è la riservatezza.
Se un modello gira su una macchina interna, i documenti possono restare dentro l’ambiente aziendale. Questo è un aspetto centrale per studi legali, studi notarili, consulenti fiscali, aziende sanitarie, reparti amministrativi e imprese che gestiscono know-how proprietario.

Il secondo problema è il controllo.
Con un sistema locale si può decidere quale modello usare, come configurarlo, quali documenti indicizzare, quali regole applicare, quali log conservare e quali funzioni integrare.

Il terzo problema è la continuità operativa.
Un sistema locale può continuare a funzionare anche senza dipendere sempre da API esterne, policy di terze parti, variazioni di prezzo o limiti di utilizzo.

Il quarto problema è la specializzazione.
Un modello locale collegato a un archivio documentale, a un database, a procedure interne o a file aziendali può diventare molto più utile di un chatbot generico. Non perché “sa tutto”, ma perché viene inserito nel contesto giusto.

Questa è la vera differenza. L’AI utile in azienda non è solo il modello. È l’architettura intorno al modello.

I modelli Gemma 4 e le risorse richieste

La famiglia Gemma 4 include diversi tagli. Ogni modello ha un equilibrio diverso tra capacità, velocità, memoria richiesta e scenario di utilizzo.

Le risorse indicate qui sotto sono valori orientativi per l’inferenza e dipendono dalla precisione utilizzata. In generale, un modello in BF16 richiede più memoria ma conserva più precisione; un modello in 8-bit riduce il consumo; un modello quantizzato a 4-bit è più leggero e più adatto a macchine locali, ma può avere qualche compromesso qualitativo.

Modello Memoria BF16 Memoria 8-bit Memoria 4-bit Uso consigliato
Gemma 4 E2B circa 11,4 GB circa 5,7 GB circa 2,9 GB test, edge, applicazioni leggere, dispositivi meno potenti
Gemma 4 E4B circa 17,9 GB circa 8,9 GB circa 4,5 GB assistenti locali, automazioni, piccoli agenti, analisi testuali leggere
Gemma 4 12B circa 26,7 GB circa 13,4 GB circa 6,7 GB laptop avanzati, workstation consumer, agenti multimodali più seri
Gemma 4 26B A4B circa 57,7 GB circa 28,8 GB circa 14,4 GB workstation importanti, server locali, workflow agentici più complessi
Gemma 4 31B circa 69,9 GB circa 34,9 GB circa 17,5 GB workstation/server, ragionamento più avanzato, applicazioni più esigenti

Questi numeri vanno letti con attenzione.
Non significano che basti avere esattamente quella quantità di memoria per lavorare sempre bene. La memoria richiesta può crescere in base alla lunghezza del contesto, al numero di token generati, al software usato, alla gestione della GPU, al sistema operativo e alla configurazione dell’inferenza.

Per esempio, un modello da 6,7 GB in 4-bit può sembrare perfetto per una GPU da 8 GB, ma se si usa un contesto molto lungo o un runtime poco ottimizzato, la memoria può non bastare. In questi casi una parte del carico può finire sulla RAM di sistema, con un impatto sulla velocità.

E2B ed E4B: i modelli leggeri

Gemma 4 E2B ed E4B sono i modelli più leggeri della famiglia. La lettera “E” indica il concetto di parametri effettivi. Sono modelli pensati per ottenere il massimo possibile da architetture più compatte, soprattutto in scenari on-device o edge.

Gemma 4 E2B è adatto a test rapidi, piccoli assistenti, prototipi e applicazioni dove la leggerezza è più importante della profondità di ragionamento. Può avere senso su dispositivi meno potenti o in progetti dove il modello deve rispondere velocemente a compiti semplici.

Gemma 4 E4B è probabilmente il primo modello interessante per molti usi pratici. In quantizzazione 4-bit richiede una quantità di memoria molto gestibile e può essere usato per assistenti locali, analisi di testi, classificazione, automazioni leggere, estrazione di informazioni e piccoli agenti.

Non lo sceglierei per attività complesse di ragionamento strategico, analisi molto lunghe o produzione di codice avanzato. Ma come base per applicazioni locali controllate può essere molto utile.

Gemma 4 12B: il punto di equilibrio più interessante

Gemma 4 12B è forse il modello più interessante per chi vuole costruire un sistema locale serio senza entrare subito nel mondo delle workstation estreme.

È abbastanza più potente dei modelli piccoli, ma resta ancora compatibile con hardware consumer evoluto, soprattutto se usato in quantizzazione. È il modello che può avere più senso per laptop potenti, PC con GPU da 12 o 16 GB, workstation compatte e ambienti di sviluppo locali.

Il suo ruolo è chiaro: colmare il divario tra i modelli leggeri e i modelli più pesanti da server. Per un consulente, uno sviluppatore o una piccola azienda, Gemma 4 12B può essere una buona base per:

Cosa cambia per l'azienda

  • analisi documentale;
  • assistenti interni;
  • RAG su procedure aziendali;
  • supporto alla scrittura tecnica;
  • analisi SEO;
  • supporto al coding;
  • classificazione di documenti;
  • prototipi di agenti AI;
  • strumenti locali per uffici professionali.

È probabilmente il modello da cui partirei per un progetto concreto, se l’hardware lo consente.

Gemma 4 26B A4B: il modello MoE

Gemma 4 26B A4B è un modello Mixture-of-Experts. Questo significa che il modello ha molti parametri complessivi, ma durante l’inferenza ne attiva solo una parte per ogni token. In teoria, questo approccio consente di aumentare la capacità complessiva senza usare sempre tutto il modello in modo denso.

Ma c’è un punto importante: anche se il modello attiva solo una parte dei parametri durante la generazione, deve comunque caricare in memoria l’intera struttura necessaria per funzionare correttamente. Quindi non bisogna fare l’errore di pensare: “attiva solo 4 miliardi di parametri, quindi pesa come un 4B”. Non è così. Gemma 4 26B A4B richiede risorse importanti. In 4-bit può essere gestibile su workstation con GPU capiente o con configurazioni miste GPU/RAM, ma non lo considererei un modello “leggero”. È più adatto a scenari in cui servono capacità superiori: workflow agentici, ragionamenti più complessi, tool use, coding assistant più strutturati e applicazioni locali più ambiziose.

Gemma 4 31B: più capacità, più hardware

Gemma 4 31B è il modello più pesante della famiglia principale. Può offrire capacità maggiori, ma richiede hardware adeguato. Anche in 4-bit, il peso indicativo è superiore a quello che molte GPU consumer possono gestire comodamente, soprattutto se si vuole lavorare con contesti lunghi e prestazioni accettabili. Ha senso in un ambiente da workstation seria o server locale, non come primo modello da installare su un normale PC da ufficio. Per molte aziende, partire direttamente da un 31B può essere sbagliato. Non perché il modello non sia valido, ma perché aumenta la complessità: più memoria, più gestione tecnica, più costi, più attenzione alla configurazione. In molti casi è meglio partire da E4B o 12B, validare il caso d’uso e poi decidere se salire di taglia.

Come usare Gemma 4 in locale

Ci sono diversi modi per usare modelli come Gemma 4 in locale. Il modo più semplice per testare è usare strumenti come LM Studio o Ollama. Permettono di scaricare modelli, avviarli localmente e interrogarli tramite interfaccia grafica o API locali.

LM Studio è molto utile per chi vuole sperimentare modelli diversi senza entrare subito nella complessità tecnica. Si può caricare un modello, avviare un server locale compatibile con le API OpenAI e poi collegarlo a un’app Python o Streamlit.

Ollama è un’altra strada molto pratica, soprattutto per chi vuole usare modelli locali tramite riga di comando o API HTTP.

Per chi vuole più controllo, invece, esistono soluzioni come llama.cpp, llama-cpp-python, Hugging Face Transformers, vLLM e altri runtime di inferenza. Sono più tecnici, ma permettono di costruire applicazioni più integrate e meno dipendenti da software esterni.

La scelta dipende dallo scopo.

Se vuoi testare modelli e prompt, LM Studio è comodo.
Se vuoi prototipare velocemente, Ollama è molto pratico.
Se vuoi costruire un’app professionale installabile, ha senso valutare una soluzione più integrata, come llama-cpp-python o un server locale controllato direttamente dall’applicazione.

Il vero valore: RAG e agenti specializzati

Il punto più importante non è solo far girare Gemma 4 in locale. Il vero valore nasce quando il modello viene collegato ai dati aziendali.

Un modello locale, da solo, è comunque un modello generico. Può rispondere, scrivere, riassumere, ragionare e produrre codice, ma non conosce automaticamente le procedure interne di uno studio, i documenti di un cliente, le fatture archiviate, i contratti, gli atti, le policy aziendali o i report commerciali. Per renderlo utile, serve una struttura intorno. Qui entra in gioco il RAG, cioè Retrieval-Augmented Generation.

In pratica, i documenti aziendali vengono indicizzati in un sistema locale. Quando l’utente fa una domanda, il sistema cerca i passaggi più pertinenti nei documenti e li fornisce al modello come contesto. Il modello non deve “inventare” la risposta: deve lavorare sui testi recuperati. Questo approccio è fondamentale per ridurre allucinazioni, aumentare la pertinenza e trasformare l’AI da chatbot generico a strumento operativo. Un esempio pratico: uno studio notarile potrebbe avere un sistema AI locale che consulta atti, bozze, procedure interne e modelli documentali. Un poliambulatorio potrebbe usarlo per interrogare documenti amministrativi, report di controllo di gestione e procedure. Un’azienda tecnica potrebbe collegarlo a manuali, schede prodotto, offerte, norme e documentazione interna.

In tutti questi casi, il modello non è il prodotto finale. Il prodotto finale è l’agente costruito sopra il modello. Cloud e locale non sono nemici
Una delle letture più sbagliate è pensare che l’AI locale debba sostituire completamente l’AI cloud. Non è necessario. In molti casi, la soluzione migliore sarà ibrida. Il cloud resta utile quando servono modelli molto potenti, aggiornati, multimodali avanzati, con grande capacità di ragionamento o integrazioni esterne complesse. Il locale diventa utile quando servono privacy, controllo, personalizzazione, costi prevedibili e integrazione con dati interni.

Un’architettura intelligente potrebbe usare:

  • AI locale per documenti riservati, procedure interne e prime analisi;
  • AI cloud per task più complessi, generazione avanzata, validazione o elaborazioni che richiedono modelli superiori;
  • RAG locale per mantenere il controllo sui dati;
  • database e log interni per tracciare le attività;
  • interfacce semplici per gli utenti finali.

Metodo e prossimi passi

Il punto non è scegliere una bandiera tecnologica.
Il punto è progettare bene.

Perché Gemma 4 è rilevante per consulenti, sviluppatori e PMI

Per consulenti digitali, sviluppatori, aziende e studi professionali, Gemma 4 è rilevante perché rende più credibile un’offerta di AI locale. Fino a poco tempo fa, proporre un computer dedicato all’AI sembrava una cosa da laboratorio tecnico. Oggi può diventare una proposta concreta. Una workstation configurata correttamente può ospitare modelli locali, database vettoriali, strumenti di indicizzazione, interfacce Streamlit, sistemi di login, pannelli di amministrazione, log di utilizzo e agenti verticali.

Questo apre diversi scenari: un agente per analisi SEO locale; un assistente per leggere e interrogare documenti PDF; un sistema per analizzare fatture e produrre report; un agente per controllo di gestione; un assistente per studi legali o notarili; un copilota interno per uffici tecnici; un sistema di knowledge management aziendale; un’app AI privata per reparto amministrativo o commerciale.

In questi casi, il valore non sta solo nella potenza del modello. Sta nella capacità di costruire una soluzione completa: hardware, modello, dati, interfaccia, regole, workflow e manutenzione.

I limiti da considerare

Naturalmente, l’AI locale non è una soluzione magica. Ci sono limiti tecnici e operativi. Il primo è l’hardware.
I modelli più potenti richiedono GPU con molta memoria. Una GPU da 8 GB può bastare per modelli piccoli o medi quantizzati, ma non per tutto.

Il secondo è la velocità.
Un modello locale può essere più lento di un modello cloud ottimizzato su infrastrutture enormi.

Il terzo è la qualità.
A parità di task, un modello cloud frontier può essere ancora superiore, soprattutto su ragionamento complesso, conoscenza generale, coding avanzato e multimodalità pesante.

Il quarto è la manutenzione.
Modelli, runtime, librerie e dipendenze cambiano. Serve qualcuno che sappia aggiornare, testare e mantenere il sistema.

Il quinto è la sicurezza applicativa.
Avere il modello in locale non basta per essere sicuri. Bisogna gestire accessi, permessi, backup, log, cifratura, isolamento dei dati e controllo delle fonti.

Quindi l’AI locale va progettata. Non basta installarla.

Conclusione: la domanda non è se usare AI, ma con quale architettura

Gemma 4 è interessante perché conferma una direzione ormai evidente: l’intelligenza artificiale sta diventando più distribuita. Non vivrà solo nei grandi data center. Entrerà anche nei computer aziendali, nelle workstation degli studi professionali, nei server locali, nei dispositivi edge e nei sistemi verticali costruiti su misura. Per le aziende questo significa una cosa precisa: non basta chiedersi “quale modello usiamo?”.

La domanda corretta è più ampia:

Quali dati vogliamo usare?
Dove devono restare questi dati?
Quali attività vogliamo automatizzare?
Quali utenti dovranno usare il sistema?
Serve il cloud, il locale o una soluzione ibrida?
Quali rischi dobbiamo controllare?
Quale valore operativo vogliamo ottenere?

Gemma 4 non è solo un nuovo modello da aggiungere alla lista. È un segnale del fatto che l’AI locale sta diventando una possibilità concreta, economicamente e tecnicamente più accessibile. Il futuro dell’AI aziendale non sarà fatto solo di chatbot. Sarà fatto di architetture.

E chi saprà progettare queste architetture, collegando modelli, dati, applicazioni e processi reali, avrà un vantaggio molto più solido di chi si limiterà semplicemente a “usare l’intelligenza artificiale”.