텍스트 인코딩
제 리더는 파일의 인코딩을 알고 있을까요, 아니면 추측하고 있을까요?
text-encoding 프리셋은 이 질문에 대한 실제 테스트 파일 세트 전체를 명령 하나로 만들고, 그 옆에 시스템이 각 파일에 어떻게 반응해야 하는지 알려 주는
manifest.json을 둡니다. 아래의 모든 내용은 이 버전의 기본값으로 프로그램에서 읽어 온 것입니다.
보통 무엇을 찾아내나요?
- UTF-8로 가정하여 UTF-16 파일을 세 글자에 한 글자만, 또는 네모 칸의 행으로 보여 주는 리더
- 바이트 순서 표시를 내용으로 읽어서 가져오기의 첫 필드가 낯선 문자 세 개로 시작하는 문제
- 앞쪽 바이트로 인코딩을 추측하고 더 긴 파일에서는 다르게 추측하는 임포터
- 각 줄 뒤에 빈 줄이 생기며 행으로 나뉘는 CRLF 파일, 또는 마지막 필드에 남는 캐리지 리턴
세트에는 무엇이 들어 있나요?
기본값에서 tfg preset show text-encoding가 보고하는 대로입니다.
| 파일 수 | 20 |
|---|---|
| 레시피의 타깃 수 | 20 |
| 총 크기 | 81 920 B |
| 형식 | csv, log, md, txt, xml |
그리고 그 세트의 매니페스트가 시스템에 기대하는 것:
| 기대값 | 의미 | 파일 수 |
|---|---|---|
accept | 시스템은 이 파일을 받아야 합니다. | 10 |
unspecified | 시스템의 규칙에 따라 다릅니다. 직접 결정한 뒤 실제 일어나는 일이 의도한 것인지 확인하세요. | 10 |
무엇을 바꿀 수 있나요?
| 설정 | 값 | 기본값 | 동작 |
|---|---|---|---|
--sample |
2mb와 같은 크기 | 4kb |
세트에 포함된 각 파일의 크기입니다. UTF-16은 글자당 2바이트를 저장하므로 홀수는 거부됩니다. |
어떻게 실행하나요?
세트의 비용을 확인하고, 만들거나, 편집할 레시피를 꺼냅니다.
tfg preset show text-encoding
tfg generate --preset text-encoding --out ./text-encoding
tfg preset eject text-encoding > text-encoding.yaml
또는 테스트 옆에 둔 직접 만든 레시피에서 이를 바탕으로 이어 갑니다.
version: 1
extends: preset:text-encoding