«In futuro ad avere davvero valore non sarà tanto possedere l'account di un certo modello, quanto sapere quando usare quello economico, quando quello costoso e quando non usarne proprio nessuno.»
🔀 Il mercato dei modelli AI si sta spaccando in due fasce
Mettere Grok 4.5 e Claude Fable 5 uno accanto all'altro nella stessa settimana suona come un segnale netto lanciato dall'industria: i modelli economici stanno diventando acqua, luce e gas — un'infrastruttura di base — mentre i modelli di punta si trasformano in una risorsa scarsa e regolamentata.
Quando qui diciamo "economici" non intendiamo che manchino di capacità: stiamo dicendo che stanno entrando in uno strato infrastrutturale pensato per prezzi bassi, alta frequenza e chiamate massicce. Forse non sono i più potenti, ma sono già sufficienti per una gamma enorme di compiti quotidiani: riassunti, classificazione, riscritture, customer care, ricerca aumentata, piccole modifiche di codice, script di automazione, gestione dei fogli di calcolo e domande-risposte sulla conoscenza interna.
Quello che invece sta diventando più caro, più difficile da ottenere e più scarso è l'altra fascia: ragionamento all'avanguardia, agenti a ciclo lungo, migrazioni di codice complesse, cybersecurity e knowledge work ad alto rischio in finanza, diritto e scienze della vita.
🟢 Grok 4.5: modelli forti che scendono negli strumenti di tutti i giorni
xAI ha rilasciato Grok 4.5 l'8 luglio 2026, con un posizionamento chiaro su coding, agentic tasks e knowledge work. Cursor lo ha integrato in simultanea su desktop, web, iOS, CLI e SDK. Prezzi: $2/M in input, $6/M in output (la variante fast: $4/M e $18/M).
Non è un prezzo "stracciato", ma il segnale è chiaro: i modelli ingegneristici sempre più forti vengono impacchettati nel flusso di lavoro quotidiano dello sviluppatore, non più riservati a pochi laboratori di ricerca.
🔴 Fable 5: il modello di frontiera dietro una serie di cancellelli
Anthropic ha rilasciato Claude Fable 5 il 9 giugno 2026. Il 12 giugno i controlli all'export del governo statunitense hanno imposto di limitarne l'accesso: non potendo verificare la nazionalità dell'utente in tempo reale, Anthropic è arrivato a sospendere tutti gli utenti. Il 30 giugno il controllo è stato revocato e il 1° luglio l'accesso globale è stato ripristinato.
Le restrizioni non sono sparite: sono semplicemente passate da una sospensione di massa a meccanismi più fini di accesso, prezzo, dati e sicurezza.
Prezzi di Fable 5: $10/M in input, $50/M in output. Richiede una retention dei dati di 30 giorni, quindi non è adatto a scenari a retention zero, e blocca i comportamenti di cybersecurity dual-use ad alto rischio.
Differenza chiave: Grok 4.5 rappresenta "il modello forte che scende negli strumenti di tutti i giorni"; Fable 5 rappresenta "la capacità più potente avvolta in meccanismi di compliance, sicurezza e fiducia".
💰 Economico non significa solo bolletta più bassa: cambia il modo di usare l'AI
Quando una singola chiamata è sufficientemente economica, i product manager, le operations, i ricercatori e gli ingegneri smettono di trattare l'AI come "l'esperto che si convoca solo prima di una decisione importante" e iniziano a trattarla come un componente residente dentro il processo.
La domanda di una volta: "Ne vale la pena chiamare il modello più forte per questo problema?"
La domanda di oggi: "Posso far girare di default il modello economico 20 volte in questa pipeline e passare solo i casi difficili al modello di punta?"
🔀 Il model routing è la nuova architettura
Questo ridisegnerà l'architettura dei prodotti. Le applicazioni AI del futuro non saranno costruite intorno a un unico modello più forte, ma intorno al model routing:
- Compiti semplici → modello economico
- Compiti verificabili → modello economico con votazione multipla
- Compiti con rilevazione chiara dei fallimenti → agente low-cost
- Compiti ad alto valore, bassa frequenza, complessi e difficili da verificare → modello di frontiera
È per questo che la competizione sui modelli economici si farà sempre più accesa. Non si contendono "chi è il più intelligente", ma "chi diventa lo strato di chiamata di default". Una volta consolidato quello strato, il volume di chiamate, il contesto, i punti di ingresso del flusso di lavoro e le abitudini degli sviluppatori vi si depositano sopra. Forse non avrà il margine più alto, ma avrà la frequenza più alta.
🎯 Cosa significa per te
Se sei un utente singolo: non ha più senso rincorrere solo "il modello più forte". Le domande importanti diventano altre:
- Possibile svolgere l'80% di questo compito con un modello economico?
- Il risultato è verificabile?
- Quanto costa sbagliare?
- Mi serve davvero un modello di frontiera?
Se sei un team aziendale: non legare l'architettura AI a un unico modello di punta. L'approccio più solido è costruire una strategia a strati:
- Alta frequenza, basso rischio: lascia girare in automatico il modello economico
- Complessità media: prima il modello economico, poi uno più forte per campionamenti di controllo
- Decisioni critiche: modello di punta + revisione umana + log di audit
- Domini ad alto rischio: verifica policy di accesso del fornitore, retention dei dati e meccanismi di rifiuto — non solo la capacità del modello
🌍 Il ruolo di China AI Arbitrage in questo scenario
Questa realtà a due fasce è esattamente il motivo per cui abbiamo costruito il sito. La fascia dei "modelli economici come infrastruttura" è oggi guidata dai provider AI cinesi:
- DeepSeek V4 Flash: $0,14/M in input, $0,28/M in output — con cache hit che scende fino a $0,0028/M (anche al prezzo di punta raddoppiato resta l'API di frontiera più economica)
- GLM-4.7-Flash: completamente gratuito — contesto di 200K, costo zero
- MiniMax M3: $0,30/M in input, sconto del 50% per sempre, contesto da 1 milione
- Xiaomi MiMo V2.5: $0,14/M in input, open source con licenza MIT
Questi modelli non sono "peggiori": sono infrastruttura. Sono lo strato che ti permette di chiamare l'AI 20 volte dentro la pipeline senza dover pensare al costo.
La nostra
Il futuro non è avere il modello migliore, ma sapere quale usare e quando. È esattamente questo che ti aiutiamo a fare.
Ispirazione: l'analisi di AI Inspiration Flash sul mercato dei modelli AI a due fasce. La citazione in apertura è tratta da quell'articolo.