Codificación de texto
¿Sabe mi lector en qué codificación está un archivo, o lo adivina?
El preset text-encoding construye con un solo comando un conjunto entero de archivos de
prueba reales para esta pregunta, y un manifest.json a su lado que dice cómo debe
reaccionar tu sistema a cada archivo. Todo lo de abajo se lee del programa, con los valores por
defecto de esta versión.
¿Qué suele encontrar?
- un lector que supone UTF-8 y muestra un archivo UTF-16 con un carácter de cada tres, o como filas de cuadros
- una marca de orden de bytes leída como contenido, de modo que el primer campo de una importación empieza con tres caracteres extraños
- un importador que adivina la codificación por los primeros bytes y adivina distinto con un archivo más largo
- un archivo CRLF partido en filas con una fila vacía después de cada una, o un retorno de carro que queda dentro del último campo
¿Qué hay en el conjunto?
Con sus valores por defecto, tal como lo informa tfg preset show text-encoding:
| Archivos | 20 |
|---|---|
| Targets en su receta | 20 |
| Tamaño total | 81 920 B |
| Formatos | csv, log, md, txt, xml |
Y lo que el manifiesto de ese conjunto espera de tu sistema:
| Esperado | Significado | Archivos |
|---|---|---|
accept | Tu sistema debe aceptar el archivo. | 10 |
unspecified | Depende de las reglas de tu sistema. Tú decides y después compruebas que lo que ocurre es lo que querías. | 10 |
¿Qué puedes cambiar?
| Ajuste | Admite | Por defecto | Qué hace |
|---|---|---|---|
--sample |
un tamaño como 2mb | 4kb |
El tamaño de cada archivo del conjunto. UTF-16 guarda dos bytes por carácter, así que un número impar se rechaza. |
¿Cómo se ejecuta?
Mira cuánto costaría el conjunto, constrúyelo o toma su receta para editarla:
tfg preset show text-encoding
tfg generate --preset text-encoding --out ./text-encoding
tfg preset eject text-encoding > text-encoding.yaml
O construye sobre él en una receta propia, junto a tus pruebas:
version: 1
extends: preset:text-encoding