L’onda arriva ogni anno. Perché ci sorprende ancora?

In molte organizzazioni, l’arrivo di un picco di lavoro scatena una reazione prevedibile: dichiarazione di emergenza, straordinari improvvisati, la solita discussione sul personale insufficiente. E la frase che si sente più spesso in questi momenti è qualcosa del tipo: “Cosa possiamo farci? Ci è piombato addosso”.

Il problema è che raramente è vero.

I dati tolgono l’alibi

Guardiamo il caso reale in figura. Il dataset copre agosto 2024 – marzo 2026 e mostra il volume settimanale delle richieste in arrivo su un servizio operativo. Il grafico non mostra un andamento caotico: mostra un pattern.

A settembre 2024 il volume settimanale sale da una media di ~37 unità a 117–126. A giugno 2025 il picco è ancora più marcato: 178, poi 144, poi 200 nella settimana di punta. A settembre 2025 si ripete: 174 in una settimana. Il dataset si ferma a marzo 2026, ma se qualcuno in quella organizzazione stesse aspettando di “vedere come va” a giugno 2026, starebbe solo perdendo tempo.

L’onda arriva due volte l’anno, arriva sempre nello stesso periodo, e la sua magnitudo è nell’ordine di 4–5 volte il volume ordinario. Non è una sorpresa: è un appuntamento fisso scritto nei grafici dell’anno precedente.

Dalla sensazione alla misurazione

La differenza tra un’organizzazione che subisce i picchi e una che li gestisce non è la dimensione del team: è la cultura del dato.

Fino a quando l’unica fonte di informazione è la percezione soggettiva della fatica – “ci sembra di essere sommersi” – non c’è modo di quantificare quanto sia grande l’onda né di prepararsi in anticipo. Quando invece si lavora con dati storici strutturati, il ragionamento cambia: si può misurare la magnitudo del picco, si può confrontarla con la capacità disponibile, e si può calcolare quanto margine serve.

Il metodo Kanban fornisce esattamente questa infrastruttura di misura. Ma la misura da sola non basta: bisogna incrociare i dati della domanda con quelli della capacità. E qui entra in gioco il secondo fattore spesso trascurato.

I picchi di domanda tendono a coincidere con i periodi di minore disponibilità interna: le ferie estive si sovrappongono al picco di giugno, la stagione influenzale autunnale arriva insieme al picco di settembre. I dati storici delle Risorse Umane sull’incidenza delle assenze – se li si incrocia con la curva della domanda – permettono di anticipare questo combinato disposto di fattori con mesi di anticipo. Non servono modelli sofisticati: basta voler guardare i numeri.

La strategia: capacità flessibile, non eroismo individuale

Una volta accettato che i picchi sono prevedibili, la domanda diventa operativa: come si struttura la risposta?

La soluzione non è aumentare l’organico fisso per coprire i momenti di punta – sarebbe capacità sprecata per undici mesi l’anno. La soluzione è progettare una capacità flessibile, che si espande sui picchi e si contrae nei periodi ordinari.

In pratica questo si può realizzare in due modi:

  • Con fornitori esterni dimensionati in anticipo – partner già contrattualizzati, istruiti sul processo, pronti a subentrare quando il volume supera la soglia.
  • Con riserve interne trasversali – colleghi di altri reparti che in quel periodo hanno un carico inferiore, formati preventivamente sulle attività di supporto, attivabili su richiesta.

Il punto critico è preventivamente. Formare qualcuno durante un picco è inutile: il tempo di formazione va sottratto alla capacità già sotto pressione. La formazione va fatta nei mesi di calma, quando c’è il margine per farlo bene.

Nel caso reale dell’esempio, affrontato con questo approccio, la calibrazione non è avvenuta con un modello matematico ma con sperimentazione empirica: si è provato, si è osservato e misurato cosa succedeva al flusso, si è calibrata la capacità di riserva fino a trovare il punto di equilibrio. Quanta capacità in più serve esattamente per non essere sommersi? La risposta è nei dati della domanda durante i picchi passati.

Due tipi di variabilità, due risposte diverse

Arrivati a questo punto e alla luce degli articoli scritti precedentemente sul tema, è utile distinguere tra due nature diverse della variabilità, perché richiedono risposte diverse.

La variabilità stocastica – il rumore quotidiano, le fluttuazioni casuali intorno alla media – si gestisce con i principi classici della teoria delle code. Non si satura il sistema: si mantiene un buffer di capacità, si lavora sulla riduzione del WIP, si applica la formula di Kingman per tenere sotto controllo i tempi di attesa. Qui il problema è di calibrazione continua.

La variabilità stagionale è un fenomeno diverso. Non si tratta di rumore attorno a una media: si tratta di una variazione strutturale della scala del problema. La risposta non è ottimizzare i parametri interni – è cambiare la capacità del sistema. E questa è una decisione di pianificazione, non di gestione operativa.

Confondere le due cose è il principale errore che porta a rincorrere i picchi invece di prepararsi.

Vale la pena osservare che entrambe le forme di variabilità discusse in questo articolo – il rumore stocastico quotidiano e i picchi stagionali – rientrano nel dominio che Nassim Taleb chiama Mediocristan: la media è significativa, i pattern sono stabili, la distribuzione del lead time è prevedibile. È precisamente questo che rende possibile pianificare. In un sistema in Extremistan, dove un singolo elemento di lavoro può durare cento volte la mediana, nessuna delle strategie descritte qui funzionerebbe allo stesso modo. Come scegliere la strategia giusta in base alla natura statistica del proprio flusso è l’argomento dell’articolo precedente Anticipare o differire? Come leggere il proprio flusso per decidere al momento giusto.

Il lavoro di riserva: cosa fare se l’onda non arriva

L’obiezione più comune che ricevo per questo approccio è legittima: “e se quest’anno il picco è meno intenso del solito? Abbiamo pagato capacità in eccesso inutilmente.”

Il rischio esiste, ma si può mitigare. A chi è stato ingaggiato nella riserva si assegnano in parallelo attività a bassa priorità – miglioramenti, arretrati di manutenzione, documentazione, formazione interna – classificabili come lavoro intangible secondo le Classi di Servizio Kanban. Se il picco arriva nella sua forma attesa, queste attività vengono sospese e la capacità viene dirottata sul flusso principale. Se il picco è più contenuto, il team ha comunque generato valore su attività che altrimenti sarebbero rimaste indefinitamente in coda.

In entrambi i casi, l’organizzazione è in una posizione migliore rispetto a quella di chi non si è preparato.

Conclusione

I grafici in questo articolo mostrano dati reali di un servizio operativo. Chi gestisce quel servizio sa che a giugno c’è da aspettarsi un picco intorno a 150–200 unità di lavoro settimanali. La domanda non è se l’onda arriva, ma se l’organizzazione ha scelto di vederla in anticipo o di scoprirla quando si è già stati travolti.

In molti casi, gestire l’imprevedibile è soprattutto una questione di volontà di guardare i propri dati. Il caos non nasce dai picchi: nasce dalla scelta di ignorarli fino a quando non è troppo tardi.

Sotto il 65%: quando la variabilità abbassa la soglia di efficienza del flusso

In un articolo precedente ho utilizzato la Teoria delle Code – e nello specifico la Legge di Little come caso particolare – per spiegare perché un sistema di flusso raggiunga la sua massima efficienza intorno al 65% del carico massimo teorico. Questo articolo si rivolge a chi vuole approfondire le basi matematiche di quel risultato e capire cosa succede quando le ipotesi semplificatrici del modello di partenza vengono rilassate.

Il modello sottostante, che ora possiamo nominare esplicitamente, si chiama M/M/1: una coda con un unico canale di servizio (1), arrivi casuali senza memoria secondo una distribuzione di Poisson (la prima M, da Markovian) e tempi di servizio con distribuzione esponenziale (la seconda M). In notazione estesa di Kendall si scriverebbe M/M/1/∞, dove ∞ indica che non c’è limite alla lunghezza della coda, ma per convenzione il quarto elemento si omette quando è infinito.

C’è però un’assunzione nascosta, che vale la pena portare in superficie: il modello M/M/1 fissa la variabilità del sistema a un valore preciso e implicito. Il 65% è corretto, ma solo per quel livello di variabilità. Se il sistema è più regolare, la soglia si alza. Se è più caotico, si abbassa.

La formula che permette di generalizzare questo risultato si chiama formula di Kingman, o equazione VUT. È il punto di arrivo naturale del ragionamento che abbiamo iniziato.

Cosa mancava nel modello precedente

Nel modello M/M/1, sia gli arrivi che i tempi di servizio seguono distribuzioni con una proprietà specifica: il loro coefficiente di variazione – il rapporto tra deviazione standard e media – è esattamente pari a 1.

Questo significa che stavamo implicitamente assumendo una variabilità “standard” sia per gli arrivi che per i tempi di lavorazione. Nella realtà queste assunzioni reggono raramente. Un sistema in cui gli elementi di lavoro (work item) arrivano a ondate – fine mese, fine sprint, richieste urgenti in cluster – ha una variabilità degli arrivi ben superiore a 1. Un sistema in cui alcuni task richiedono un’ora e altri una settimana ha una variabilità dei tempi di servizio anch’essa superiore a 1.

La domanda diventa: come cambia il Tempo di Ciclo quando la variabilità non è quella “standard” del modello M/M/1?

La formula di Kingman

La risposta la fornisce John Kingman, matematico britannico, con una formula che generalizza M/M/1 a sistemi con distribuzioni arbitrarie di arrivi e servizi. La formula calcola una approssimazione accettabile del tempo medio di attesa in coda (Wq), cioè il tempo che un work item trascorre in attesa prima di essere preso in carico:

  • Ca² = quadrato del coefficiente di variazione degli arrivi
  • Cs² = quadrato del coefficiente di variazione dei tempi di servizio
  • ρ = λ / μ = tasso di utilizzazione del sistema, dove λ è il tasso di arrivo dei work item e μ è la capacità produttiva
  • Te = tempo medio di servizio

La formula si legge come il prodotto di tre fattori distinti:

  1. Il fattore di variabilità: (Ca² + Cs²) / 2 – cresce all’aumentare dell’irregolarità del sistema
  2. Il fattore di utilizzazione: ρ / (1 − ρ) – esplode quando ci si avvicina al 100% di carico
  3. Il tempo di servizio base: Te – scala il risultato all’unità di misura del sistema

Il tempo totale di permanenza nel sistema – il Tempo di Ciclo che ci interessa (W) – si ottiene sommando il tempo di attesa in coda con il tempo di servizio: W = Wq + Te.

M/M/1 come caso particolare

Se sostituiamo nella formula di Kingman i valori propri del modello M/M/1, ovvero Ca² = 1 e Cs² = 1, otteniamo come tempo medio di attesa in coda (Wq):

Il tempo totale nel sistema (W), che include anche il tempo di servizio, diventa:

Sostituendo Te = 1/μ e ρ = λ/μ:

Che è esattamente la formula del Ws usata nell’articolo precedente. M/M/1 è dunque un caso particolare di Kingman, valido quando la variabilità di arrivi e servizi è esattamente pari a 1.

Per completezza vale la pena notare che le formule esatte per code con distribuzioni specifiche furono sviluppate da Agner Krarup Erlang già a inizio ‘900. Kingman generalizza quel lavoro a distribuzioni arbitrarie, al prezzo di un’approssimazione, sufficientemente accurata per le analisi che ci interessano. Più recentemente Donald Reinertsen in The Principles of Product Development Flow si riferisce alla formula di Allen-Cuneen, che esprime lo stesso risultato in termini di lunghezza media della coda (Lq) anziché di tempo di attesa (Wq) – le due formule sono equivalenti e collegate dalla Legge di Little: Lq = λ · Wq.

Cosa cambia con la variabilità

Il fattore (Ca² + Cs²) / 2 è il moltiplicatore che modifica il tempo di attesa in coda (Wq) rispetto al caso M/M/1. Se è uguale a 1, siamo nel caso precedente. Se è maggiore di 1, Wq cresce proporzionalmente. Se è minore di 1, il sistema regge meglio il carico. Il tempo totale W = Wq + Te cambia di conseguenza, ma in misura attenuata perché Te rimane fisso.

Riprendiamo il sistema dell’articolo precedente: capacità produttiva μ = 10 work item al giorno per ogni giornata lavorativa di 8 ore.

Carico (λ)Utilizzo (ρ)W – bassa variabilità (Ca²=Cs²=0,5)W – M/M/1 (Ca²=Cs²=1)W – alta variabilità (Ca²=Cs²=2)
550%1h 12min1h 36min2h 24min
660%1h 24min2h3h 12min
770%1h 44min2h 40min4h 32min
880%2h 24min4h7h 12min
990%4h 24min8h15h 12min

La struttura è la stessa: il Tempo di Ciclo esplode avvicinandosi al 100%. Ma la scala cambia in modo significativo. Con alta variabilità, già al 50% di carico il sistema impiega quasi due ore e mezza per evadere un singolo work item e al 70% di carico il sistema impiega quasi cinque ore, laddove con bassa variabilità lo stesso carico del 70% sarebbe invece ancora ampiamente gestibile.

Il 65% potrebbe essere ottimistico

Il risultato pratico è diretto: la soglia del 65% vale per il caso M/M/1, cioè per un sistema con variabilità “standard”. Nel lavoro di concetto (knowledge work) e nei servizi dove le richieste arrivano in modo irregolare e i tempi di lavorazione possono variare molto da un task all’altro, Ca² e Cs² sono tipicamente superiori a 1.

Questo significa che il 65% è, in molti contesti reali, una stima ottimistica. La soglia di efficienza reale si abbassa. Un sistema con alta variabilità può richiedere di operare al 50% o anche meno per mantenere Tempi di Ciclo accettabili.

Le leve per migliorare il flusso

“Festina lente” (Affrettati lentamente – Svetonio)

Reinertsen suggerisce e rende esplicite tre leve distinte per la gestione delle code, con efficacia e natura diverse. Vale la pena passarle in rassegna.

1. Ridurre il carico (ρ) – leva dominante

È la leva del limite al lavoro in corso (WIP limit): tenere il sistema al di sotto della soglia di saturazione. Il fattore di utilizzazione ρ/(1−ρ) cresce in modo superlineare, a ρ=0,9 vale 9, a ρ=0,95 vale 19. Agire su ρ produce effetti sproporzionatamente grandi rispetto all’entità dell’intervento.

2. Ridurre la variabilità (Ca² e Cs²) – leva incrementale

Il fattore di variabilità entra nella formula in modo lineare rispetto a Ca² e Cs²: raddoppiare la variabilità raddoppia Wq, nulla di più. Nel concreto significa regolarizzare il flusso degli arrivi e ridurre la dispersione dei tempi di lavorazione – standardizzazione, suddivisione dei task in unità più omogenee. Nel knowledge work tuttavia la variabilità è difficile da comprimere per ragioni strutturali: è nella natura del lavoro cognitivo. La riduzione della variabilità è un miglioramento incrementale sopra la leva dominante, non un’alternativa ad essa.

3. Gestire la sequenza della coda – leva compensativa

Quando la coda esiste, l’ordine con cui i work item vengono processati ha un valore economico misurabile. Nel manifatturiero, dove i job sono di solito omogenei per durata e costo del ritardo, FIFO (First-In-First-Out) è ottimale e non c’è nulla da ottimizzare nella sequenza. Nel lavoro di concetto i work item sono eterogenei per definizione, e una disciplina di gestione della coda (queueing discipline) esplicita crea valore. Le due euristiche di base: a parità di durata, prima il job con costo del ritardo più alto; a parità di costo del ritardo, prima il job più corto. Nel linguaggio Kanban, questa leva si traduce in classi di servizio e policy di replenishment.

Vale però sottolineare che la queueing discipline è uno strumento compensativo: serve perché siamo lontani dall’ottimo, non è una soluzione strutturale. L’obiettivo ideale è avere code così piccole da non richiedere discipline di priorità e ci si arriva agendo sulle prime due leve.

Un vantaggio comune alle leve 1 e 3

Limitare il WIP e gestire la sequenza della coda sono interventi su variabili soft: si attuano con una decisione di policy, sono immediati e reversibili. Aumentare la capacità produttiva (μ) è invece una variabile hard: assumere, formare, riorganizzare sono azioni lente e costose. Questa asimmetria pratica rafforza ulteriormente la priorità delle leve operative rispetto all’investimento in capacità.

Quanto costa non avere capacità in eccesso

Fino a qui abbiamo ragionato in termini di flusso. C’è però una formalizzazione economica del problema che vale la pena esplicitare, particolarmente utile quando si deve giustificare una scelta di capacity management a un imprenditore o un responsabile aziendale.

Il costo totale di un sistema in coda è la somma di due componenti che si muovono in direzioni opposte:

  • Cc = costo unitario della capacità (il costo di avere una persona in più, un server in più)
  • CD = costo unitario del ritardo (il valore economico del tempo perso in attesa)
  • Cc·μ = costo totale della capacità, che cresce linearmente con μ
  • CD·λ/(μ−λ) = costo totale del ritardo, che decresce all’aumentare di μ e diverge quando μ converge verso il valore di λ

Il minimo del costo totale si trova in:

La lettura è diretta: la capacità ottimale è sempre superiore al tasso di arrivo – operare al 100% non è mai ottimale economicamente. La distanza dall’ottimo dipende dal rapporto CD/Cc: quanto più il costo del ritardo è alto rispetto al costo della capacità, tanto più conviene investire in capacità in eccesso.

Per chi deve prendere queste decisioni, il ragionamento si traduce in una domanda concreta: quanto costa, nella mia organizzazione, un giorno di ritardo su un work item tipico? Se la risposta è “molto” – cliente che aspetta, opportunità che sfuma, deadline contrattuale a rischio – allora la capacità in eccesso non è uno spreco, è un investimento con un rendimento calcolabile. Operare “al risparmio” sulla capacità può essere la scelta economicamente peggiore.

Conclusione

La Legge di Little ci dice che WIP (L), tasso di arrivo (λ) e Tempo di Ciclo (W) sono legati. Il modello M/M/1 mostra come il Tempo di Ciclo esploda avvicinandosi alla saturazione. Kingman completa il quadro: l’esplosione è amplificata dalla variabilità, e variabilità e utilizzazione si moltiplicano, non si sommano.

Il 65% rimane un riferimento utile. Ma in un sistema ad alta variabilità, come può essere il knowledge work, è una soglia da cui partire verso il basso, non un obiettivo da raggiungere. Le leve per migliorare il flusso esistono, hanno efficacia diversa, e – cosa non trascurabile – le più potenti sono anche le più facili da azionare.

Bibliografia

  1. John F.C. Kingman, The single server queue in heavy traffic, Mathematical Proceedings of the Cambridge Philosophical Society, 1961
  2. Paul Newbold, Principles of Management Science, Prentice-Hall, 1986
  3. Donald G. Reinertsen, The Principles of Product Development Flow, Celeritas Publishing, 2009