● BOLLETTINO OPERATIVO · SAB 26 SET 2026 · 02:39 CET EN / IT / RSS / NEWSLETTER

Constitutional AI: come Anthropic allinea Claude senza eserciti di annotatori

Constitutional AI e' il metodo con cui Anthropic addestra Claude a essere utile e sicuro: due fasi, una costituzione pubblica, meno dipendenza dal feedback umano.

Chi ha usato Claude per qualche settimana si accorge che il modello si comporta in modo diverso da ChatGPT. Rifiuta in modo piu’ articolato, spiega il perche’, resta quasi sempre sul punto senza moralismi a raffica. Non e’ un caso ne’ un tono scelto dal marketing: e’ la conseguenza diretta di come Anthropic lo allinea, con un metodo chiamato Constitutional AI.

Il problema di partenza: l’allineamento costa

Per rendere un modello linguistico utile e non pericoloso serve feedback. La strada classica, usata da OpenAI su GPT-3.5 e GPT-4, si chiama RLHF: Reinforcement Learning from Human Feedback. In pratica migliaia di annotatori umani leggono coppie di risposte e scelgono quella migliore, il modello impara da quelle scelte.

Funziona, ma ha due problemi concreti. Primo, costa tantissimo: ogni giudizio umano e’ una persona pagata che legge, valuta, clicca. Secondo, gli annotatori non sono trasparenti: le loro preferenze diventano parte del modello senza che nessuno le veda scritte da qualche parte.

La costituzione: principi scritti, pubblici, leggibili

Anthropic ha preso una strada diversa. Invece di accumulare giudizi umani impliciti, ha scritto una lista di principi espliciti che Claude deve rispettare. Questa lista si chiama costituzione ed e’ pubblicata sul sito di Anthropic, chiunque puo’ leggerla.

I principi arrivano da fonti diverse e dichiarate:

  • Dichiarazione Universale dei Diritti Umani delle Nazioni Unite
  • Termini di servizio di piattaforme come Apple, per quello che riguarda contenuti problematici
  • Principi interni di Anthropic sull’onesta’ e sull’evitare danni
  • Linee guida su come trattare modelli linguistici non occidentali

Non e’ una Bibbia. E’ un documento finito, rivedibile, discutibile. La scelta di renderlo pubblico significa che se Claude si comporta in un certo modo, il motivo e’ leggibile da fuori.

Le due fasi: critique e RLAIF

Il training vero e proprio si svolge in due fasi successive. La prima si chiama critique and revision. Il modello di partenza genera risposte a prompt potenzialmente problematici, poi riceve in input la costituzione e il suo stesso output e deve criticarsi, individuando quali principi sta violando. Dopo la critica scrive una versione riveduta. Si procede cosi’ per molti esempi, finche’ il modello impara a produrre risposte gia’ allineate.

La seconda fase si chiama RLAIF: Reinforcement Learning from AI Feedback. Invece di annotatori umani che scelgono la risposta migliore, e’ un altro modello AI che lo fa, guidato dalla costituzione. Il modello giudice confronta coppie di risposte, decide quale rispetta meglio i principi, e il modello studente viene aggiornato di conseguenza.

Il trucco e’ che il giudice non inventa criteri: li estrae dalla costituzione scritta. Quindi il processo e’ riproducibile e verificabile.

Cosa cambia rispetto a RLHF

Le differenze pratiche tra i due approcci sono nette:

  • Scala: RLAIF non ha bisogno di migliaia di annotatori, puo’ generare milioni di giudizi in modo automatico
  • Trasparenza: in RLHF i criteri vivono nella testa degli annotatori, in Constitutional AI sono in un file di testo
  • Iterazione: modificare un principio e rilanciare il training e’ piu’ veloce che riaddestrare un team umano
  • Bias: resta il problema, ma sposta da centinaia di persone anonime a un documento pubblico che si puo’ contestare

Attenzione: Anthropic non dice che RLAIF sostituisce del tutto il feedback umano. Nelle fasi finali di tuning e per casi difficili gli umani intervengono ancora. Ma la massa del lavoro di allineamento passa attraverso il modello critico.

L’impatto sul carattere di Claude

Questa scelta tecnica si vede nel comportamento quotidiano. Quando Claude rifiuta una richiesta, tende a motivare il rifiuto con un principio specifico, non con un generico “non posso farlo”. Quando risponde su temi controversi prova a mostrare piu’ lati invece di arroccarsi. Quando non e’ sicuro di qualcosa lo dice, invece di inventare.

Funzioni piu’ recenti come Artifacts e Computer Use poggiano su questa base. Un agente che prende il controllo del mouse e della tastiera deve avere un’idea chiara di cosa non deve fare: Constitutional AI fornisce quel guard rail in modo esplicito, non implicito.

Le critiche al metodo

Non tutti sono convinti. Le obiezioni piu’ serie sono due. La prima: chi ha scritto la costituzione? Un gruppo di persone ad Anthropic, con la loro cultura e le loro priorita’. Il fatto che sia pubblica non elimina il bias, lo rende leggibile.

La seconda obiezione riguarda il fatto che il modello giudichi se stesso. Se il modello ha un difetto sistematico nel valutare una certa classe di risposte, l’RLAIF amplifica quel difetto invece di correggerlo. Serve comunque una sanity check umana, altrimenti il sistema rischia di chiudersi in un loop.

Perche’ ha senso discuterne oggi

Nel 2024 Anthropic ha lanciato parecchie cose vistose: Claude 3.5 Sonnet, Computer Use, la nuova serie Haiku. Constitutional AI e’ una scelta meno appariscente ma piu’ strutturale, perche’ definisce come il modello si comporta in scenari nuovi, quelli che nessuno aveva previsto al momento del training.

In un momento in cui gli agenti AI iniziano a eseguire azioni reali, la domanda “chi decide cosa il modello puo’ fare” non e’ piu’ teorica. Avere quei criteri scritti, pubblici, modificabili e’ una risposta possibile. Non e’ l’unica e non e’ perfetta, ma almeno mette il problema sul tavolo invece di nasconderlo dentro a un team di annotatori.

Vale la pena leggere la costituzione di Claude, e’ un documento breve. La domanda interessante non e’ se i principi sono giusti, ma chi dovrebbe deciderli la prossima volta.