Codarea textului
Știe cititorul meu în ce codare este un fișier sau doar ghicește?
Presetarea text-encoding construiește cu o singură comandă un set întreg de fișiere de test
reale pentru această întrebare, și un manifest.json alături care spune cum trebuie să
reacționeze sistemul tău la fiecare fișier. Tot ce urmează este citit din program, la valorile
implicite ale acestei versiuni.
Ce găsește de obicei?
- un cititor care presupune UTF-8 și arată un fișier UTF-16 cu un caracter din trei sau ca rânduri de pătrățele
- o marcă de ordine a octeților citită ca și conținut, astfel încât primul câmp al unui import începe cu trei caractere străine
- un importator care ghicește codarea din primii octeți și ghicește altfel pentru un fișier mai lung
- un fișier CRLF împărțit în rânduri cu un rând gol după fiecare sau un retur de car rămas în ultimul câmp
Ce este în set?
La valorile implicite, așa cum le raportează tfg preset show text-encoding:
| Fișiere | 20 |
|---|---|
| Targeturi în rețeta lui | 20 |
| Dimensiune totală | 81 920 B |
| Formate | csv, log, md, txt, xml |
Și ce așteaptă manifestul acelui set de la sistemul tău:
| Așteptat | Semnificație | Fișiere |
|---|---|---|
accept | Sistemul tău trebuie să accepte fișierul. | 10 |
unspecified | Depinde de regulile sistemului tău. Tu decizi, apoi verifici că ce se întâmplă este ce ai vrut. | 10 |
Ce poți schimba?
| Setare | Primește | Implicit | Ce face |
|---|---|---|---|
--sample |
o dimensiune precum 2mb | 4kb |
Cât de mare este fiecare fișier din set. UTF-16 stochează doi octeți pentru fiecare caracter, așa că un număr impar este refuzat. |
Cum o rulezi?
Vezi cât ar costa setul, construiește-l sau ia-i rețeta ca s-o editezi:
tfg preset show text-encoding
tfg generate --preset text-encoding --out ./text-encoding
tfg preset eject text-encoding > text-encoding.yaml
Sau construiește peste ea într-o rețetă proprie, lângă testele tale:
version: 1
extends: preset:text-encoding