Come hai scritto il testo?
Non uso PreGeo ma DoCFa, tuttavia “conosco alcune magagne”
Per esempio i “caratteri fantasma”
Nel lontano passato usavo IrfanView per le immagini (ma non solo)
è possibile “leggere” il testo esadecimale
Ho “chiesto” alla prima IA disponibile (AI Mode) una sorta di “alternativa”
Su Windows “esiste” Notepad standard ma occorre Notepad++
Si può installare oppure usare versione portable Notepad++
Se inglese si imposta italiano
Occorre installare Plugin → Gestione plugin → HEX-Editor
Oppure “caricare” servizi gratuiti on-line, per esempio …
Ho chiesto ad AI Mode di “scrivere” un testo con caratteri nascosti
Mi ha scritto quali e dove si trovano poi eseguito “test visivi”
Questo “servizio” non vede
Riga 5: Alla fine della parola “Libretto” c’è un carattere di controllo SOH (Start of Heading, U+0001), evidenziato in Notepad++ con una scritta bianca su sfondo nero.
Di nuovo ho chiesto ad AI Mode …
Capisco perfettamente il problema: molti pulitori online moderni (incluso quello di CharCount che abbiamo analizzato) sono ottimizzati specificamente per ripulire i testi generati dalle Intelligenze Artificiali. Per questo motivo, intercettano benissimo i fantasmi Unicode moderni come gli spazi a larghezza zero o i BOM, ma ignorano i vecchi caratteri di controllo ASCII come il SOH (U+0001), che appartengono alla preistoria dell’informatica (i famosi codici da 00 a 31). [1, 2, 3]
Dato che i tracciati Pregeo usano ancora lo standard ministeriale basato su questi vecchi sistemi, ti servono strumenti capaci di rilevare l’intero spettro dei caratteri, sia vecchi che nuovi.
Ecco tre ottimi servizi online alternativi che “vedono” anche il carattere SOH e i vecchi codici di controllo:
1. Diffchecker (Modalità Text Compare)
Nato come strumento per confrontare due testi, ha una delle gestioni dei caratteri invisibili più potenti del web.
- Come usarlo: Incolla il testo simulato nel pannello di sinistra.
- Cosa succede: Non appena incolli il testo, Diffchecker mostra immediatamente dei bollini rossi o grigi con la scritta
SOH, ZWSP o BOM esattamente nei punti critici. Ti permette di vederli graficamente prima ancora di fare qualsiasi modifica.
2. Unicode Lookup / Unicode Analyzer
Se vuoi un servizio che faccia una “radiografia” clinica riga per riga (molto simile allo stile esadecimale a cui ti stai abituando).
- Siti consigliati: unicodelookup.com oppure compart.com
- Cosa succede: Incolli il testo e il sito genera una tabella. Per ogni singolo elemento ti dirà il nome ufficiale standard (es.
START OF HEADING per la riga 5, ZERO WIDTH JOINER per la riga 0). Non pulisce in automatico, ma è infallibile per la diagnosi.
3. CyberChef (Lo “Scatolone Svizzero” degli sviluppatori)
È un’applicazione web gratuita formidabile creata dai servizi di sicurezza britannici (GCHQ) per manipolare i dati. Funziona interamente nel browser ed è l’equivalente moderno dei vecchi software programmati con efficienza.
- Come usarlo: Incolla il testo nel box “Input”. Nella colonna “Operations” a sinistra, cerca l’operazione “Remove Null bytes” o “Strip HTTP headers” oppure usa una Regex.
- Il vantaggio: Ha una funzione chiamata “Find / Replace” che supporta le espressioni regolari. Se usi la stringa che ti ho dato nel messaggio precedente, CyberChef polverizzerà istantaneamente sia i codici Unicode che il vecchio
SOH della riga 5.
La soluzione definitiva “Fatta in Casa” su Notepad++
Visto che hai installato la versione Portable, il modo più sicuro in assoluto per non dipendere da internet e intercettare anche il SOH è aggiornare la stringa di ricerca direttamente nel tuo Notepad++.
Se fai CTRL + H (Espressione regolare) e usi questa stringa aggiornata, includerà anche il SOH (\x01) che il sito online ha saltato:
text
[\x{200B}\x{200C}\x{200D}\x{FEFF}\x{00A0}\x{00AD}\x01]