Кодування тексту
Чи знає мій читач, у якому кодуванні файл, чи вгадує?
Пресет text-encoding однією командою збирає цілий набір справжніх тестових файлів для цього
питання та поруч manifest.json з очікуваною реакцією вашої системи на кожен файл. Усе
нижче прочитано з програми зі значеннями за замовчуванням цієї версії.
Що він зазвичай знаходить?
- читач, що припускає UTF-8 і показує файл UTF-16 з одним символом із трьох або рядами квадратиків
- позначка порядку байтів, прочитана як вміст, через що перше поле імпорту починається з трьох зайвих символів
- імпортер, що вгадує кодування за першими байтами й вгадує інакше для довшого файлу
- файл CRLF, розбитий на рядки з порожнім рядком після кожного, або повернення каретки, що залишилося в останньому полі
Що входить у набір?
Зі значеннями за замовчуванням, як повідомляє tfg preset show text-encoding:
| Файлів | 20 |
|---|---|
| Цілей у його рецепті | 20 |
| Загальний розмір | 81 920 B |
| Формати | csv, log, md, txt, xml |
І чого маніфест цього набору очікує від вашої системи:
| Очікується | Значення | Файлів |
|---|---|---|
accept | Ваша система має прийняти файл. | 10 |
unspecified | Залежить від правил вашої системи. Ви вирішуєте, а потім перевіряєте, що відбувається саме те, що ви мали на увазі. | 10 |
Що можна змінити?
| Налаштування | Приймає | За замовчуванням | Що робить |
|---|---|---|---|
--sample |
розмір, наприклад 2mb | 4kb |
Розмір кожного файлу набору. UTF-16 зберігає по два байти на символ, тому непарне число відхиляється. |
Як його запустити?
Подивіться, скільки коштував би набір, зберіть його або візьміть його рецепт для правки:
tfg preset show text-encoding
tfg generate --preset text-encoding --out ./text-encoding
tfg preset eject text-encoding > text-encoding.yaml
Або будуйте на ньому у власному рецепті поряд із тестами:
version: 1
extends: preset:text-encoding