从混合文本中提取需要的内容
整理日志、收集联系方式、检查网页文本或从说明文档中建立清单时,可以先把混合内容粘贴到输入框,再选择数字、邮箱、网址、IPv4 或域名中的一种类型。每次只执行一种提取,结果按出现顺序逐行输出。默认自动去重,也可以关闭以保留重复出现的记录。页面同时显示匹配数量和结果数量,便于区分原文出现次数与最终保留条目。它只识别文字中的形式,不判断这些信息是否真实有效。
提取结果放在普通文本框,不把网址渲染成自动访问的链接,也不联网检查邮箱或主机是否存在。这样可以先核对内容,再决定如何使用。复制结果适合继续去重、排序或粘贴到表格的一列,下载文本适合保存当前清单。原文仍留在输入区,方便检查某个条目的上下文。若输入或选项变化,旧结果会清除,需要重新执行,避免把此前类型的清单误认为最新输出。
数字模式得到的是数字片段清单,不会知道某一段是日期、价格、编号还是电话。一个带分隔符的电话号码可能拆成多个片段,日期也可能按各部分输出。整理业务数据时,应结合字段与上下文判断含义,不能只靠匹配形式分类。如果需要把结果与原文行号对应起来,应保留原文并另行建立映射,本工具目前只输出匹配内容和数量。
数字和常见邮箱的识别范围
数字模式识别整数、小数和负数,保留文本中的原始拼写。例如 123、-123 和 1.23 可以分别输出。它不是数学表达式解析器,不会计算公式、读取单位或把带逗号的数字分组自动合并;科学计数法和版本号也可能被拆成多个数字片段。若需要保持银行卡号、长订单号或带前导零的编码,结果不会先转换成数值,避免仅因转换而丢掉前导零或精度。
邮箱模式针对常见的英文字母、数字与常用允许符号组成的地址,支持多级域名和常见顶级域。它会排除一些明显不完整的形式,例如域名缺失或本地部分出现连续点,但并不声称覆盖全部邮件标准。带引号的特殊本地部分、国际化邮箱和罕见语法可能无法提取。提取出地址也不表示该邮箱存在、能够收信或允许联系。默认去重按字符串本身进行,大小写不同的地址可能分别保留。
网址支持路径、参数和片段
网址模式识别明确带有 http 或 https 协议的候选内容,再使用标准 URL 解析检查其结构。路径、查询参数和片段标记会保留在结果中,适合从说明文字里整理完整链接。网址前后的常见中文句末标点会作为边界,末尾的英文标点和不平衡右括号会尝试清理,避免把正文标点带进链接。只有 www 开头而没有协议的文字不属于网址模式,可以到域名模式查看主机名。
正文与 URL 的边界在纯文本中并不总能准确判断。链接本身可能合法包含括号、句号、逗号或特殊符号,启发式清理也可能误删你本来需要的末尾字符。处理正式链接清单时,应对照原文抽查路径、参数和片段,特别是带复杂括号的地址。工具不会跟随跳转、下载页面或检测响应状态,结果只是语法上可解析的候选网址。应用场景若需要验证链接可用性,应在授权范围内另行检查。
IPv4 验证和域名提取的区别
IPv4 模式要求四个点分隔的十进制部分,每段在零到二百五十五之间,因此 192.168.1.1 可以保留,999.1.1.1 会排除。为了减少有歧义的表示,多位且以零开头的部分不被接受,例如 01.2.3.4。工具不支持 IPv6,也不会据此判断地址是否公网、是否可达或属于某个组织。普通数字提取与地址验证是不同模式,不要把数字模式得到的片段当作已校验地址。
域名模式既可以从网址中读取 hostname,也可以识别常见的裸域名。网址中的路径和查询字符串不会被再次当作裸域名扫描,减少把文件名误提取为主机的情况。输出保留完整子域,例如 www.example.co.uk,并不会猜测它的可注册根域。这里不内置公共后缀列表,所以不能把最后两个片段简单当作所有域名的根域。从标准 URL 读取的国际化主机名可能显示为编码形式,裸域名规则主要面向常见 ASCII 写法。
去重、顺序与大文本处理建议
自动去重只对提取后的相同字符串合并,保留第一次出现的顺序,不自动排序。网址大小写、参数顺序和末尾斜杠不同可能得到多个结果,因为它们不能随意视为同一个资源。域名读取后统一为小写,但不会剥掉所有子域或给主机添加协议。若你希望进一步整理清单,可以复制到文本去重和排序工具,先确认业务上的唯一性规则,再选择合并方式,避免误删实际不同的条目。
核心提取在浏览器本地后台线程中完成,不把原文发给应用后端,也不对匹配到的地址发出访问请求。超过五兆字节会提醒等待,超大日志仍可按块处理,但跨块条目和批次间重复需要最后汇总检查。页面不保存历史,也不替代专业解析器、完整邮箱校验或域名归属服务。建议先用包含正例、反例和边界标点的样本验证结果,再处理整份文档,最后抽查提取数量和容易误识别的上下文。