การเข้ารหัสข้อความ
ตัวอ่านของฉันรู้ไหมว่าไฟล์ใช้การเข้ารหัสอะไร หรือกำลังเดาอยู่
พรีเซ็ต text-encoding สร้างชุดไฟล์ทดสอบจริงทั้งชุดสำหรับคำถามนี้ด้วยคำสั่งเดียว และมี
manifest.json อยู่ข้างๆ ที่บอกว่าระบบของคุณควรตอบสนองต่อแต่ละไฟล์อย่างไร
ทุกอย่างด้านล่างอ่านจากโปรแกรม ที่ค่าเริ่มต้นของเวอร์ชันนี้
โดยทั่วไปมันพบอะไร
- ตัวอ่านที่สมมติว่าเป็น UTF-8 แล้วแสดงไฟล์ UTF-16 เป็นหนึ่งอักขระในทุกสามอักขระ หรือเป็นแถวของกล่องสี่เหลี่ยม
- เครื่องหมายลำดับไบต์ที่ถูกอ่านเป็นเนื้อหา ทำให้ช่องแรกของการนำเข้าขึ้นต้นด้วยอักขระแปลกปลอมสามตัว
- ตัวนำเข้าที่เดาการเข้ารหัสจากไบต์แรกๆ และเดาต่างออกไปกับไฟล์ที่ยาวกว่า
- ไฟล์ CRLF ที่ถูกแบ่งเป็นแถวพร้อมแถวว่างหลังทุกแถว หรือตัวอักขระขึ้นต้นบรรทัดที่ค้างอยู่ในช่องสุดท้าย
ในชุดมีอะไร
ที่ค่าเริ่มต้น ตามที่ tfg preset show text-encoding รายงาน:
| ไฟล์ | 20 |
|---|---|
| target ในสูตรของมัน | 20 |
| ขนาดรวม | 81 920 B |
| รูปแบบ | csv, log, md, txt, xml |
และสิ่งที่แมนิเฟสต์ของชุดนั้นคาดหวังจากระบบของคุณ:
| ที่คาดหวัง | ความหมาย | ไฟล์ |
|---|---|---|
accept | ระบบของคุณควรยอมรับไฟล์นี้ | 10 |
unspecified | ขึ้นอยู่กับกฎของระบบของคุณ คุณเป็นผู้ตัดสิน แล้วตรวจสอบว่าสิ่งที่เกิดขึ้นตรงกับที่ตั้งใจ | 10 |
คุณเปลี่ยนอะไรได้บ้าง
| การตั้งค่า | รับ | ค่าเริ่มต้น | ทำอะไร |
|---|---|---|---|
--sample |
ขนาด เช่น 2mb | 4kb |
แต่ละไฟล์ในชุดมีขนาดเท่าไร UTF-16 เก็บสองไบต์ต่ออักขระ ดังนั้นเลขคี่จะถูกปฏิเสธ |
รันอย่างไร
ดูว่าชุดจะมีต้นทุนเท่าไร สร้างมัน หรือเอาสูตรของมันไปแก้ไข:
tfg preset show text-encoding
tfg generate --preset text-encoding --out ./text-encoding
tfg preset eject text-encoding > text-encoding.yaml
หรือสร้างต่อยอดจากมันในสูตรของคุณเอง ไว้ข้างการทดสอบของคุณ:
version: 1
extends: preset:text-encoding