Metin kodlaması
Okuyucum bir dosyanın hangi kodlamada olduğunu biliyor mu, yoksa tahmin mi ediyor?
text-encoding hazır ayarı, bu soru için tek komutla gerçek test dosyalarından oluşan bütün
bir set ve yanında sisteminizin her dosyaya nasıl tepki vermesi gerektiğini söyleyen bir
manifest.json kurar. Aşağıdaki her şey programdan, bu sürümün varsayılanlarıyla
okunur.
Genelde ne bulur?
- UTF-8 varsayıp bir UTF-16 dosyasını üç karakterde bir karakter olarak veya kutu sıraları olarak gösteren okuyucu
- içerik olarak okunan bir bayt sırası işareti, böylece bir içe aktarmanın ilk alanı üç yabancı karakterle başlar
- kodlamayı ilk baytlardan tahmin edip daha uzun bir dosyada farklı tahmin eden bir içe aktarıcı
- her satırdan sonra boş bir satırla satırlara bölünen CRLF dosyası veya son alanda kalan bir satır başı karakteri
Sette ne var?
Varsayılanlarda, tfg preset show text-encoding çıktısının bildirdiği gibi:
| Dosya | 20 |
|---|---|
| Tarifindeki hedefler | 20 |
| Toplam boyut | 81 920 B |
| Biçimler | csv, log, md, txt, xml |
Ve o setin manifestinin sisteminizden beklediği:
| Beklenen | Anlamı | Dosya |
|---|---|---|
accept | Sisteminiz dosyayı kabul etmeli. | 10 |
unspecified | Sisteminizin kurallarına bağlı. Siz karar verirsiniz, sonra olanın amaçladığınız şey olduğunu doğrularsınız. | 10 |
Neyi değiştirebilirsiniz?
| Ayar | Aldığı | Varsayılan | Ne yapar |
|---|---|---|---|
--sample |
2mb gibi bir boyut | 4kb |
Setteki her dosyanın büyüklüğü. UTF-16 her karakter için iki bayt saklar, bu yüzden tek sayı reddedilir. |
Nasıl çalıştırılır?
Setin neye mal olacağına bakın, kurun veya düzenlemek için tarifini alın:
tfg preset show text-encoding
tfg generate --preset text-encoding --out ./text-encoding
tfg preset eject text-encoding > text-encoding.yaml
Ya da testlerinizin yanında kendi tarifinizde onun üzerine kurun:
version: 1
extends: preset:text-encoding