Kódování textu
Ví moje čtečka, v jakém kódování soubor je, nebo hádá?
Předvolba text-encoding sestaví jediným příkazem celou sadu skutečných testovacích souborů
pro tuto otázku a vedle nich manifest.json, který říká, jak má váš systém na každý
soubor reagovat. Vše níže se čte z programu při výchozích hodnotách této verze.
Co obvykle najde?
- čtečka, která předpokládá UTF-8 a zobrazí soubor UTF-16 jako každý třetí znak nebo jako řady čtverečků
- označení pořadí bajtů přečtené jako obsah, takže první pole importu začíná třemi cizími znaky
- importér, který hádá kódování z prvních bajtů a u delšího souboru hádá jinak
- soubor CRLF rozdělený na řádky s prázdným řádkem za každým, nebo návrat vozíku zůstávající v posledním poli
Co je v sadě?
Při výchozích hodnotách, jak je hlásí tfg preset show text-encoding:
| Soubory | 20 |
|---|---|
| Targety v receptu | 20 |
| Celková velikost | 81 920 B |
| Formáty | csv, log, md, txt, xml |
A co od vašeho systému očekává manifest té sady:
| Očekáváno | Význam | Soubory |
|---|---|---|
accept | Váš systém má soubor přijmout. | 10 |
unspecified | Záleží na pravidlech vašeho systému. Rozhodnete vy, a pak ověříte, že to, co se stane, je to, co jste chtěli. | 10 |
Co můžete změnit?
| Nastavení | Přijímá | Výchozí | Co dělá |
|---|---|---|---|
--sample |
velikost, například 2mb | 4kb |
Jak velký je každý soubor sady. UTF-16 ukládá dva bajty na znak, takže lichý počet je odmítnut. |
Jak ji spustit?
Podívejte se, kolik by sada stála, sestavte ji, nebo si vezměte její recept k úpravě:
tfg preset show text-encoding
tfg generate --preset text-encoding --out ./text-encoding
tfg preset eject text-encoding > text-encoding.yaml
Nebo na ní stavte ve vlastním receptu vedle svých testů:
version: 1
extends: preset:text-encoding