L’integrazione di Large Language Model (LLM) e di sistemi di agentic AI nelle piattaforme di sicurezza sposta il modello di costo dal licensing prevedibile al consumo variabile, misurato in base al numero di token utilizzati.
Ecco le evidenze disponibili sulla dinamica dei prezzi dell’inference, sui consumi dei workload investigativi e sulle prestazioni degli agenti, e soprattutto le implicazioni per la governance dei budget di sicurezza.
Per oltre due decenni la spesa per la sicurezza informatica ha seguito schemi di pricing sostanzialmente deterministici: licenze per endpoint, subscription per utente e canoni proporzionali al volume di dati elaborati.
Questi schemi rendevano il budget una grandezza pianificabile su base annuale.
L’adozione di Large Language Model (LLM) e, più di recente, di architetture basate su agentic AI nelle piattaforme di detection e response introduce una logica differente. Il costo marginale di ciascuna operazione dipende dal numero di token elaborati in fase di inference e, quindi, dalla complessità del singolo compito, e non dall’area coperta.
Il token, unità minima di elaborazione testuale dei modelli, diventa di fatto l’unità di misura della sicurezza assistita dall’AI. E la spesa si trasforma in una voce operativa variabile, priva di un tetto naturale [11].
Questo fenomeno convive con un paradosso apparente. I prezzi unitari dell’inference sono in rapida discesa.
Secondo l’AI Index 2025 della Stanford University, il costo per interrogare un modello con prestazioni equivalenti a GPT-3.5 sul benchmark MMLU è passato da 20 dollari per milione di token, a novembre 2022, a 0,07 dollari, a ottobre 2024, con una riduzione superiore a 280 volte in circa diciotto mesi [1].
Le analisi di Epoch AI stimano cali compresi tra 9 e 900 volte l’anno, a seconda del task considerato [2].
Inoltre, l’analisi storica a lungo termine indica una riduzione dai 60 dollari per milione di token dell’API di GPT-3 nel 2020 ai circa 0,10 dollari dei tier economici all’inizio del 2026 [3].
La diminuzione dei prezzi a parità di prestazioni non implica però una riduzione della spesa.
Il mercato dell’inference si è stratificato su fasce di prezzo che coprono quattro ordini di grandezza [3].
I modelli frontier destinati ai compiti più complessi mantengono listini elevati: Claude Mythos Preview, il modello che Anthropic ha riservato ai partner di Project Glasswing per attività di vulnerability research, è disponibile a 25 dollari per milione di token in input e 125 in output [9].
Quando la domanda si sposta verso modelli più potenti e verso workload che moltiplicano il numero di token consumati per singolo compito, la spesa aggregata può aumentare, anche se il prezzo unitario diminuisce.
Sono state individuate tre caratteristiche che rendono le security operations un caso limite dell’economia dei token.
La prima è il volume. Gli ambienti cloud generano infatti quotidianamente milioni di eventi di telemetria, dei quali gli analisti riescono a indagare a fondo solo una minima parte [7].
Al secondo posto è la continuità operativa, che esclude finestre di inattività in cui sospendere i consumi.
La terza, decisiva, è la profondità delle indagini. Un’investigazione è un processo multi-hop che attraversa sorgenti eterogenee accumulando contesto a ogni passaggio, come illustrato da ExCyTIn-Bench, il benchmark pubblicato da Microsoft che modella il compito su 57 tabelle di log di Microsoft Sentinel e servizi collegati [4].
Stime di settore collocano il triage di un singolo alert nell’ordine di un migliaio di token. Invece un’indagine guidata può richiederne tra i 20.000 e i 50.000 per incidente [11].
Il costo della funzione varia, quindi, in base alla profondità dell’analisi e non in base al numero di postazioni.
Nonostante questi consumi, i rendimenti restano modesti.
Nella configurazione base di ExCyTIn-Bench, i modelli valutati ottengono un reward medio di 0,249, con un massimo di 0,368 [4].
Su SEC-bench, che misura task reali di security engineering, i migliori agenti non superano il 18% di successo nella generazione di proof-of-concept e il 34% nel patching delle vulnerabilità [5].
Pertanto, il rapporto tra costi e benefici dovrebbe essere misurato in base all’esito conseguito e non al numero di token consumati.
Si aggiunge un’asimmetria strutturale tra offesa e difesa.
La letteratura sulla calibrazione degli agenti di incident response riporta casi di agenti frontier in grado di produrre oltre quaranta exploit funzionanti in sei scenari.
La spesa di calcolo è compresa tra 30 e 50 dollari. Il fattore limitante è ormai il token throughput e non la competenza dell’operatore [6].
L’attaccante sostiene un costo episodico e mirato. Invece chi difende ha un costo continuo, proporzionale alla superficie monitorata.
Project Glasswing rappresenta la prima prova concreta del problema su larga scala.
Nell’ambito dell’iniziativa, Palo Alto Networks ha impiegato Claude Mythos ed altri modelli frontier per analizzare oltre 130 prodotti del proprio portafoglio, pubblicando in un solo giorno 26 advisory relative a 75 vulnerabilità. Nessuna di esse è classificata come critica [10].
La stampa di settore stima che la spesa in token per l’esercizio superi il milione di dollari [11].
Lo stesso ordine di grandezza emerge anche dal lato dell’offerta. Anthropic ha stanziato 100 milioni di dollari in crediti d’uso per i partecipanti al programma [9]. La cifra dà la misura dei consumi attesi quando modelli frontier vengono applicati in modo sistematico a basi di codice estese.
Per chi amministra i budget di sicurezza, la conseguenza più immediata riguarda la prevedibilità. Il passaggio da costi fissi a OpEx variabile espone l’organizzazione a fenomeni di throttling.
Inoltre, un’indagine interrotta per esaurimento del plafond dei token non costituisce una copertura adeguata, ma un rischio operativo da trattare come un inconveniente commerciale.
Ne consegue un tema contrattuale. I modelli a consumo dei vendor, i meccanismi di credito e le politiche di degradazione del servizio devono essere esplicitati in fase negoziale con la stessa attenzione riservata agli SLA.
Dal punto di vista architetturale, le strategie di model routing a cascata, che riservano i modelli economici al triage e i frontier model alle sole escalation, insieme alle tecniche di caching e alla delimitazione del retrieval, incidono sul consumo più di qualunque rinegoziazione tariffaria.
Resta infine il nodo della misurazione. La letteratura sulla valutazione degli agenti considera il costo come una dimensione primaria, accanto alla qualità e alla latenza [8].
I programmi di adozione dovrebbero fare altrettanto, dotandosi di sistemi di telemetria dei consumi e di pratiche FinOps estese all’AI.
Sarebbe un errore considerare il vincolo economico come un elemento critico transitorio, destinato a dissolversi con la prossima revisione dei listini.
Si tratta, infatti, di una proprietà strutturale dei sistemi agentici, il cui consumo cresce con il grado di autonomia concesso al modello.
La risposta più concreta consiste nel trattare i token come una risorsa di capacità ed estendere a essi la disciplina che i SOC applicano da anni a banda, storage e volumi di ingestione.
Un capacity planning dei token consente di dimensionare il budget in base al fabbisogno ordinario, misurato per caso d’uso, e di affiancare una riserva per i picchi di incidente, analoga ai retainer di incident response.
Tale riserva è governata da politiche di degradazione controllata che riducono la profondità dell’analisi prima di sospendere la copertura.
Parallelamente, il procurement dovrebbe spostare il confronto dai listini dei token al costo per indagine conclusa e per vulnerabilità validata, verificabile sui benchmark pubblici disponibili [4, 5].
A queste condizioni, il vincolo economico cessa di essere un limite immediato e diventa un parametro di progetto, consentendo all’agente AI di rafforzare le security operations senza introdurre una nuova classe di fragilità.
Vincenzo Calabro' | Ingegnere informatico specializzato in sicurezza informatica e investigazioni digitali. Autore di articoli e saggi. Lecturer, Speaker, Trainer.