Anthropic introduce filigrane invisibili in Claude: dal rilevamento passivo alla tracciabilità attiva dei contenuti

Modificato da: Svitlana Velhush

Every Claude text now has a watermark. It survives copy-paste. Anthropic rolled out invisible marks for the EU AI Act: - Statistical signal baked into the text - Holds up through light editing - Applied worldwide, not just EU users Your AI-written docs just got traceable.

Reply

Il 2 agosto 2026 Anthropic ha iniziato a incorporare nelle nuove versioni di Claude filigrane invisibili: etichette leggibili dalle macchine che rimangono nella distribuzione statistica del testo e si conservano durante la copia e la modifica parziale. Non si tratta solo di un aggiornamento tecnico, ma di uno spostamento strategico dai tentativi di rilevare i contenuti IA a posteriori all'integrazione proattiva di prove di origine già in fase di generazione.

Il meccanismo opera a livello di token: il modello modifica le probabilità di scelta delle parole in modo che nella sequenza appaia un pattern statisticamente rilevabile, che non influisce sul significato, sulla qualità e sulla leggibilità. L'azienda promette strumenti di verifica, ma i dettagli dell'algoritmo e la resistenza agli attacchi (traduzione, parafrasi, mescolanza con testo umano) non sono ancora stati completamente rivelati. A differenza dei precedenti approcci basati sull'analisi dello stile e della frequenza, la filigrana di Anthropic è un segnale attivo, integrato dal produttore.

La metodologia di Anthropic si basa sui requisiti dell'articolo 50 dell'EU AI Act, entrati in vigore proprio il 2 agosto. Il regolatore richiede ai sistemi di IA generativa di aggiungere etichette leggibili dalle macchine per identificare i contenuti IA. Ciò spiega la sincronia con altri attori: Google sta estendendo SynthID al testo, OpenAI promuove C2PA e filigrane digitali, Meta sta testando soluzioni analoghe. Tuttavia, Anthropic si distingue per il fatto di collegare la filigrana direttamente alla conformità, e non solo a iniziative interne di sicurezza.

Rispetto ai tradizionali rilevatori di IA (che analizzano la perplessità e il burstiness), la filigrana fornisce un segnale più affidabile su uno specifico modello, ma non risolve il problema della paternità mista. Uno studio pubblicato il 8 agosto su arXiv sottolinea: nell'era della collaborazione uomo-IA, la divisione binaria "umano o IA" è obsoleta. La filigrana registra il fatto che è stato utilizzato Claude, ma non mostra quale quota di testo appartenga all'umano, quali modifiche siano state apportate e chi si assuma la responsabilità finale.

I limiti sono evidenti. Modifiche su larga scala, traduzioni o la mescolanza con altri contenuti possono distruggere il segnale. L'assenza di una filigrana non prova la paternità umana: significa solo che l'etichetta non è stata inserita o è stata rimossa. Pertanto, lo strumento è utile per piattaforme ed editori come segnale aggiuntivo, ma non come "prova inconfutabile".

Per il settore, ciò significa una transizione verso un ecosistema di tracciabilità: in futuro i modelli non si limiteranno a generare testo, ma lasceranno tracce crittograficamente verificabili. Ciò semplificherà la moderazione, ma complicherà le questioni relative alla paternità, alla citazione e alla responsabilità legale. I ricercatori dovranno rispondere a come le filigrane di diversi fornitori interagiranno e se sia possibile creare uno standard universale di rilevamento.

In definitiva, le filigrane di Anthropic dimostrano che la regolamentazione sta già definendo l'agenda tecnica: la tracciabilità dei contenuti sta diventando una proprietà obbligatoria dei modelli, non una funzione opzionale.

26 Visualizzazioni

Fonti

  • 隐形水印上线,AI写作开始留痕

Leggi altri articoli su questo argomento:

This feels like another “DeepSeek” moment coming out of China. ByteDance just released Seed 2.0, also called Doubao 2.0, and it’s apparently outperforming top tier models across multimodal tasks, advanced math, STEM benchmarks, and even agent style reasoning. On top of that,

Image
Reply
Hai trovato un errore o un'inaccuratezza?Esamineremo il tuo commento il prima possibile.