TXT 编码指南

TXT 乱码通常是编码识别错了

中文 TXT 常见于 UTF-8、GBK 或 GB18030。文件本身没有声明编码时,软件只能根据字节特征判断;判断错误就会出现问号、方框或无意义字符。

开始转换

常见编码

  • UTF-8:跨平台最常见,适合长期保存。
  • GBK:较早的简体中文编码,旧 TXT 中常见。
  • GB18030:覆盖字符更多,是中文环境的重要兼容编码。

转换前如何检查

先在可靠文本编辑器中确认开头和章节标题是否正常。若全文乱码,可另存为 UTF-8 后再导入;不要在乱码状态下直接覆盖唯一原文件。

BookCrafter 如何处理

工具会优先检查 BOM 和严格 UTF-8,再结合编码检测与 GB18030 回退读取。整个过程在浏览器本地完成。

常见问题

为什么只有少数字符乱码?

可能是原文件混用了编码、包含特殊字形,或文本在早期复制时已经损坏。

改扩展名能解决乱码吗?

不能。把 .txt 改成其他扩展名不会改变文件内部字节编码。

应该统一保存成什么编码?

一般建议保留原始备份,再另存一份 UTF-8 用于后续整理和转换。