文本按行去重排序工具
对多行文本按行去重,支持保留原顺序、升序排序、倒序排列以及标注重复次数四种处理方式,可选择忽略大小写与忽略首尾空格,输出清理后的文本、原行数与去重后行数、删除条数和重复率,并列出出现最多的前 10 行。
数据来源:集合去重语义(保留首次出现)与 Unicode 排序(localeCompare zh-CN)
输入总行数10行
有效内容行10行
去重后行数5行
删除的重复行5行
重复率50%
空行数(已忽略)0行
处理方式保留原顺序
出现次数最多的前 10 行
| 排名 | 内容(原文首次出现的形式) | 出现次数 | 判定 |
|---|---|---|---|
| 1 | 订单导出 | 3 | 重复 2 次 |
| 2 | 用户反馈 | 2 | 重复 1 次 |
| 3 | API 文档 | 2 | 重复 1 次 |
| 4 | 数据分析 | 2 | 重复 1 次 |
| 5 | 轻算工具站 | 1 | 唯一 |
订单导出 用户反馈 API 文档 数据分析 轻算工具站
已忽略每行首尾空格,因此 "ABC" 与 " ABC " 视为同一条。 区分大小写,"Abc" 与 "abc" 算两条。
本页所有计算在浏览器内完成,输入内容不会被上传。
计算口径
判定重复的比较键:可选先去掉首尾空格、再统一转小写;键相同的行归为一条,输出时保留第一次出现的原始写法(不改动大小写与内部空格)。空行不参与去重与统计,避免把排版换行当数据。排序用 localeCompare 的 zh-CN 规则,中文按拼音、英文按字母顺序;标注次数用制表符分隔,可直接粘贴回 Excel 分列。
使用说明
- 从 Excel 复制一列粘贴进来(每行一条),选"去重保留原顺序"即可保持原有排列
- 做标签清单时用"去重后按拼音升序",需要新的排前面时用倒序
- 排查哪些数据重复最多时选"标注重复次数",配合前 10 行统计表定位
常见问题
为什么看起来一样的两行没被去掉?
多半是不可见差异:全角空格、末尾的空格或制表符、大小写不同、可见字符相同但含零宽字符。勾选"忽略首尾空格"和"忽略大小写"能解决前两种,若仍不生效可先用本站的全角半角转换工具清理不可见字符。
排序按什么规则?
中文按拼音(localeCompare 的 zh-CN 折叠规则),英文按字母顺序,数字与符号按 Unicode 码位优先于汉字。注意拼音多音字按常用读音处理,要求严格笔画排序时本工具不适用。
能去掉空行或前后空白以外的重复字符吗?
不能,本工具只做整行级别的去重。行内重复内容(例如一行里重复的词)需要先转成多行再处理,可用"清除多余空白"配合换行分步完成。