Mã hóa văn bản
Trình đọc của tôi có biết tệp ở mã hóa nào, hay chỉ đoán?
Preset text-encoding dựng bằng một lệnh cả một bộ tệp kiểm thử thật cho câu hỏi này, kèm
một manifest.json bên cạnh nêu cách hệ thống của bạn cần phản ứng với từng tệp. Mọi
thứ bên dưới được đọc từ chương trình, ở các giá trị mặc định của phiên bản này.
Nó thường tìm thấy gì?
- trình đọc giả định UTF-8 và hiện tệp UTF-16 thành cứ ba ký tự mới có một, hoặc thành hàng ô vuông
- dấu thứ tự byte bị đọc như nội dung, nên trường đầu tiên của lần nhập bắt đầu bằng ba ký tự lạ
- trình nhập đoán mã hóa từ các byte đầu và đoán khác đi với tệp dài hơn
- tệp CRLF bị tách thành các dòng với một dòng trống sau mỗi dòng, hoặc ký tự xuống dòng còn sót trong trường cuối
Trong bộ có gì?
Ở các giá trị mặc định, như tfg preset show text-encoding báo cáo:
| Tệp | 20 |
|---|---|
| Target trong công thức của nó | 20 |
| Tổng kích thước | 81 920 B |
| Định dạng | csv, log, md, txt, xml |
Và điều manifest của bộ đó mong đợi từ hệ thống của bạn:
| Mong đợi | Ý nghĩa | Tệp |
|---|---|---|
accept | Hệ thống của bạn nên nhận tệp. | 10 |
unspecified | Tùy vào quy tắc của hệ thống bạn. Bạn quyết định, rồi kiểm tra điều xảy ra có đúng ý bạn không. | 10 |
Bạn có thể đổi gì?
| Thiết lập | Nhận | Mặc định | Tác dụng |
|---|---|---|---|
--sample |
kích thước như 2mb | 4kb |
Mỗi tệp trong bộ lớn bao nhiêu. UTF-16 lưu hai byte cho mỗi ký tự, nên số lẻ bị từ chối. |
Chạy nó thế nào?
Xem bộ sẽ tốn bao nhiêu, dựng nó, hoặc lấy công thức của nó để chỉnh sửa:
tfg preset show text-encoding
tfg generate --preset text-encoding --out ./text-encoding
tfg preset eject text-encoding > text-encoding.yaml
Hoặc xây trên nó trong công thức của riêng bạn, bên cạnh các bài kiểm thử:
version: 1
extends: preset:text-encoding