要可靠地从网站提取公司信息,先明确你需要的字段,收集相关页面,记录每条事实及其来源,并在使用结果前核对任何对时间敏感的细节。
目标是结构化数据——而不是重写一份公司简介。一个良好的提取流程会告诉你:网站声明了什么、它在哪里声明、信息何时发布,以及哪些字段仍未知。
先定义输出的数据结构
没有结构的话,人工研究和 AI 工具往往会把所有看起来有趣的内容都收集起来。在访问网站之前,先决定目的地需要什么。
一个基础的公司数据集可能包括:
| 字段 | 示例值 | 可能来源 |
|---|---|---|
| 官方名称 | Northline Systems, Inc. | 页脚、法律页面 |
| 网站 | northline.example | 当前 URL |
| 描述 | 面向现场团队的工作流软件 | 首页、关于我们 |
| 行业 | 现场服务软件 | 产品页面 |
| 产品/服务 | 派单、排程、报表 | 产品导航 |
| 受众 | 区域服务运营商 | 解决方案页面 |
| 总部 | 丹佛,科罗拉多 | 联系我们、关于我们 |
| 成立时间 | 2018 | 关于我们、新闻包 |
| 领导层 | 姓名与当前职务 | 领导团队页面 |
| 联系方式 | 公开团队地址 | 联系我们页面 |
| 最后核验 | 2026 年 9 月 24 日 | 研究记录 |
如果是用于销售研究,你可能还会补充公开的举措、招聘信号和近期公告。对于目录类用途,分类、地点和联系方式字段可能就足够了。避免收集该使用场景不需要的个人或敏感数据。
梳理承载关键信息的页面
首页往往并不包含全部内容。查看主要导航,并收集承担明确角色的页面:
- 关于我们: 身份、历史、使命、地点;
- 产品或服务页面: 提供内容、功能与使用场景;
- 解决方案或行业: 受众与市场重点;
- 领导团队: 姓名与职务;
- 新闻中心或新闻包: 日期、里程碑、已批准的描述;
- 招聘: 团队用语与公开招聘信息;
- 联系与页脚: 地址、法律名称与公开渠道;
- 条款或隐私页面: 运营主体与司法辖区。
如果页面需要登录、被阻止或已移除,将其标记为不可用。不要依据搜索摘要推断页面内容。
带来源信息地提取主张
对每一条重要事实,都要存储:
- 字段名称;
- 提取到的值;
- 精确的来源 URL;
- 页面标题或对应的分段;
- 页面上显示的日期(如有);
- 你访问它的日期;以及
- 置信度或审核状态。
这样就把一堆复制的文本变成可审计的信息。也让更新更容易:当领导层发生变动或产品被重命名时,你知道应该回到哪个来源页面重新核对。
将网站的直接表述与分类分开处理。一个网站可能会把自己描述为“面向移动团队的运营平台”。把这句话映射为数据库类别(如“现场服务管理软件”)属于解释,应标注为一种解释,而不是原文引用。
解决冲突信息
公司网站常常会出现矛盾之处。新闻稿可能使用旧的员工人数统计,某个区域的联系页面可能把本地办公室写成总部,或者领导团队简介在角色调整后仍未更新。
使用以下规则:
- 对于变化的事实,优先选择最新的第一方来源;
- 对于运营主体和地址,优先选择法律或联系页面;
- 将日期附在各项指标上;
- 当无法解决冲突时,同时记录两种数值;
- 将该字段标记为人工复核,而不是选择更方便的答案。
外部权威来源有助于确认公开申报或法律身份,但不要把它们悄悄混入“网站提取”的数据中。要保留来源类型。
用 AI 做提取,而不是杜撰
当页面很长,或需要跨多个 URL 收集相同字段时,AI 很有帮助。给模型一个严格的结构,并要求在缺失信息时返回 null 值。
可以尝试这样的提示:
仅提取所提供网页中明确写出的信息。返回一张表,包括字段、值、来源 URL、页面日期和审核备注。字段缺失时使用“not found”。不要推断总部、成立年份、员工数量、客户、收入或市场地位。
iWeaver 的 AI 网站摘要器 可以帮助压缩公开网页内容,而 公司研究生成器 则能把多个公司来源组织成结构化研究。始终将重要字段与原始页面进行对比。
实战提取示例
假设一家软件公司的首页写着它帮助“独立诊所协调患者沟通”。它的产品页面会列出预约提醒和消息路由。关于我们页面把波士顿列为其基地,而一则两年前的公告称纽约是其总部。
正确的提取方式不是在没有说明的情况下就选用波士顿。要从当前关于我们页面记录波士顿,把较早的纽约值作为冲突备注保留,并标记总部字段以供确认。产品列表可以按页面所述进行记录。“医疗保健 SaaS”可能是一个有用的类别,但应标注为研究人员分配的分类,而不是直接引用。
清洗并规范化数据
提取完成后,在不改变含义的前提下,统一大小写、国家名称、电话号码格式和类别标签。去重那些在导航和正文中反复出现的产品名称。当数据将进入 CRM 或数据库时,请在“规范化值”之外保留“原始值”。
进行基础校验:必填字段是否齐全、URL 是否有效、日期是否采用同一种格式、在预期的情况下每个字段只有一个值,以及没有不支持的数字。对于周期性项目,把本次提取与之前的版本进行对比,以便变更能得到复核。
提取只是第一阶段
结构化的网站数据可以用于目录记录、账户简报、事实清单或写作流程。如果下一步任务是把已核验的输入转换成可读的公司内容,请查看公司信息生成器会做什么。
不要跳过这些阶段之间的边界。提取会问:“来源到底说了什么?”内容生成会问:“如何把已批准的事实呈现给这个受众?”把它们分开,能让两个输出都更可靠。
最好的提取并不是最长的那份。它是一个可追溯的数据集:包含清晰的缺口、带日期的证据,以及足够的结构,供人——或另一个系统——在不猜测事实来源的情况下使用。

