跳到内容

📝 文本文件

测试用纯文本文件

✅ 永久免费 🚫 无需注册 ⚡ 即刻下载
100 KB TXT

102,400 bytes

text/plain

100 MB TXT

104,857,600 bytes

text/plain

10 KB TXT

10,240 bytes

text/plain

10 MB TXT

10,485,760 bytes

text/plain

1 MB TXT

1,048,576 bytes

text/plain

关于文本文件

免费提供从 10 KB 到 100 MB 的纯文本文件,可用于验证文本处理、模拟日志文件以及确认编辑器对大文件的支持。

纯文本中会引发问题的变量只有两个:字符编码与换行符。按换行约定(LF / CRLF / CR / 混合)区分的文件请见 换行符测试页面。

常见使用场景

相关参考与文章

📖 常见的坑

从 10 KB 到 100 MB 的纯文本,可用于测量读取速度与确认文本处理上限。纯文本没有所谓「正确的格式」。编码与换行符是由外部给出的信息,文件本身不会声明。

情形 会发生什么 怎么处理
第一行开头混入了看不见的字符 UTF-8 的 BOM(EF BB BF)不会显示。第一个键名变成 id唯独比较不再相等 可用 head -c 3 file | xxd 确认。要在读取时去掉,PHP 可比较开头 3 字节,Python 用 encoding="utf-8-sig" 最省事。
不同工具数出来的行数不一样 wc -l 统计的是换行符的个数。若最后一行没有换行符,计数会比编辑器显示的少 1。POSIX 要求文本文件末行也应有换行符。 生成时为末行也加上换行符,差异会更干净,行数也不再对不上。若怀疑换行符混用,可用按换行符分类的测试文件确认工具行为。
打开 100 MB 的文件后进程挂了 file_get_contents()readlines()把整个文件读进内存。对 100 MB 的输入,PHP 默认的 memory_limit 不够用。 按行迭代:PHP 用 fgets(),Python 用 for line in f。一旦内存占用不再随输入大小增长,就不必反复调高上限。

文本文件不会声明自己的编码。除非有 BOM,否则一切判定都是推测。在导入流程中,让用户选择或按约定固定下来,最终比任何检测都更稳固。