Enkoding teks
Apakah pembaca saya tahu enkoding suatu file, atau hanya menebak?
Preset text-encoding membuat satu set lengkap file uji asli untuk pertanyaan ini dengan
satu perintah, dan manifest.json di sampingnya yang menyatakan bagaimana sistem Anda
harus bereaksi terhadap tiap file. Semua di bawah dibaca dari program, pada nilai bawaan versi
ini.
Apa yang biasanya ditemukan?
- pembaca yang mengasumsikan UTF-8 dan menampilkan file UTF-16 sebagai satu karakter dari tiga, atau sebagai deretan kotak
- byte order mark terbaca sebagai isi, sehingga kolom pertama impor dimulai dengan tiga karakter asing
- importer yang menebak enkoding dari byte pembuka dan menebak berbeda untuk file yang lebih panjang
- file CRLF yang terpecah menjadi baris dengan baris kosong setelah masing-masing, atau carriage return yang tertinggal di kolom terakhir
Apa isi set?
Pada nilai bawaan, seperti yang dilaporkan tfg preset show text-encoding:
| File | 20 |
|---|---|
| Target dalam resepnya | 20 |
| Ukuran total | 81 920 B |
| Format | csv, log, md, txt, xml |
Dan apa yang diharapkan manifes set itu dari sistem Anda:
| Diharapkan | Arti | File |
|---|---|---|
accept | Sistem Anda harus menerima file ini. | 10 |
unspecified | Tergantung pada aturan sistem Anda. Anda yang memutuskan, lalu memeriksa apakah yang terjadi sesuai maksud Anda. | 10 |
Apa yang dapat Anda ubah?
| Pengaturan | Menerima | Bawaan | Fungsinya |
|---|---|---|---|
--sample |
ukuran seperti 2mb | 4kb |
Seberapa besar setiap file dalam set. UTF-16 menyimpan dua byte untuk setiap karakter, sehingga angka ganjil ditolak. |
Bagaimana menjalankannya?
Lihat biaya set, buat, atau ambil resepnya untuk disunting:
tfg preset show text-encoding
tfg generate --preset text-encoding --out ./text-encoding
tfg preset eject text-encoding > text-encoding.yaml
Atau bangun di atasnya dalam resep Anda sendiri, di samping pengujian Anda:
version: 1
extends: preset:text-encoding