为什么粘进来的文本总是「脏」的
同一段文字从不同地方复制出来,样子完全不同:表格里复制的两列,粘到记事本里常常挤成一团,每行前后还多出一串空格; PDF 里复制的段落,几乎每行末尾都带一个换行,一句话被切成五六行;网页上复制的正文夹着看不见的不换行空格(U+00A0) 和零宽空格(U+200B),看着像空格,搜索却搜不到。
这不是文本坏了,而是复制时把排版信息带了出来:表格用空格对齐「列」,PDF 按视觉位置摆字, 复制时只能还原成空格和换行,并不知道哪里才是一段。
全角和半角是怎么来的
全角字符在 U+FF01–U+FF5E 这一段,与对应的半角字符(U+0021–U+007E)相差 0xFEE0,互转就是加减法, 全角空格 U+3000 对应普通空格。之所以有「全角」,是因为汉字在早期电脑上按等宽方格排版: 一个汉字占两个英文字符宽,标点也占满一格,同一个逗号于是有了全角和半角两个版本。 输入法里按 Shift + 空格就能切换,误按一次整段文字就带上全角标点,拿全角数字算金额、匹配编号都会失败。 这段区间只覆盖英文标点,中文的「。」「、」不在其中,不会被转成英文标点。
每一步都接着上一步
工具把「原文」和「结果」分成两个框,两边都留着便于对照,也不改动原文。第一次点按钮以原文为起点, 之后每点一次都接着当前结果往下做,并标出是第几步。不满意可以点「把结果作为新输入」填回原文框, 或点「重新从原文开始」让处理链归零。
去重和排序,整理名单时最有用
合并名单时,最麻烦的不是格式而是重复:同一批数据在两三张表里都录过,合并后就出现好几次,手工比对又慢又容易漏。 「去掉重复行」按整行完全一致判断、保留第一次出现的位置,所以先把行首行尾空格清掉、大小写统一,再去重才准。 排序的价值是看得出规律:名单按拼音排好,重复项会挨在一起;日志排序后,同类报错会聚到一块儿。
为什么各家的「字数统计」不一样
同一篇文章,这个编辑器说 1200 字,那个后台又是另一个数:「字数」没有统一定义,算不算标点,算不算空格, 中文按字数还是先分词按词数,英文按空格切词还是把连字符、缩写算一个词,emoji 和生僻字又占几个字符。 本站把口径拆开摆出来:总字符数按 Unicode 码点算,一个 emoji 算 1 个;中文字符数只统计常用汉字区; 英文单词数按连续英文字母串数;字节数按 UTF-8 算,这才是真正占的体积。
本工具完全在你的浏览器里运行,输入的内容不会发送到任何服务器。