Codifica del testo
Il mio lettore sa in quale codifica è un file, o tira a indovinare?
Il preset text-encoding costruisce con un solo comando un intero set di file di test reali
per questa domanda, e un manifest.json accanto che dice come il tuo sistema deve
reagire a ogni file. Tutto ciò che segue è letto dal programma, ai valori predefiniti di questa
versione.
Cosa trova di solito?
- un lettore che presume UTF-8 e mostra un file UTF-16 con un carattere ogni tre, o come file di quadratini
- un byte order mark letto come contenuto, così il primo campo di un'importazione inizia con tre caratteri estranei
- un importatore che indovina la codifica dai primi byte e indovina in modo diverso con un file più lungo
- un file CRLF diviso in righe con una riga vuota dopo ciascuna, o un ritorno a capo rimasto nell'ultimo campo
Cosa c'è nel set?
Ai valori predefiniti, come lo riporta tfg preset show text-encoding:
| File | 20 |
|---|---|
| Target nella sua ricetta | 20 |
| Dimensione totale | 81 920 B |
| Formati | csv, log, md, txt, xml |
E ciò che il manifest di quel set si aspetta dal tuo sistema:
| Atteso | Significato | File |
|---|---|---|
accept | Il tuo sistema deve accettare il file. | 10 |
unspecified | Dipende dalle regole del tuo sistema. Decidi tu, poi controlli che ciò che accade sia ciò che intendevi. | 10 |
Cosa puoi cambiare?
| Impostazione | Accetta | Predefinito | Cosa fa |
|---|---|---|---|
--sample |
una dimensione come 2mb | 4kb |
Quanto è grande ogni file del set. UTF-16 memorizza due byte per carattere, quindi un numero dispari viene rifiutato. |
Come si esegue?
Guarda quanto costerebbe il set, costruiscilo o prendi la sua ricetta da modificare:
tfg preset show text-encoding
tfg generate --preset text-encoding --out ./text-encoding
tfg preset eject text-encoding > text-encoding.yaml
Oppure costruiscici sopra in una ricetta tua, accanto ai tuoi test:
version: 1
extends: preset:text-encoding