发布时间:2025-06-12 | 分类:企业知识库搭建
一、痛点:AI 说的「你」,可能不是你的企业
很多企业做 GEO 的第一步是发内容,但忽略了一个更前置的问题:大模型手里根本没有一份关于你企业的「干净底稿」。官网一段、招商 PPT 一段、销售话术一段、1688 详情页又一段,型号、参数、成立年份互相对不上。
典型场景:客户在 AI 里问「某某品牌 A 型号设备的最大产能是多少」,模型给出的数字来自三年前的经销商页面,或者干脆把竞品参数安到了你头上。你没有任何办法去「申诉」,因为错的知识本身就是你自己散落出去的。
- 同一个产品在不同页面有 3 个以上不同名称;
- 案例只写「服务过某知名客户」,没有行业、场景、交付内容;
- 公司简介各平台版本不一致,实体名称(品牌名 / 公司名 / 商标名)混用;
- 关键参数藏在图片里,AI 抓不到文本。
二、底层逻辑:大模型怎么「认识」一家企业
理解三层机制,搭建方向就不会跑偏。
2.1 实体识别:先解决「你是谁」
大模型会把「品牌名、公司全称、产品线、创始人、技术名词」识别为实体。如果同一实体在不同页面表现为「千百顺」「千百顺GEO」「QBS GEO」多种写法且没有关联,模型就难以判定它们指向同一主体,容易出现信息拼接错误。
2.2 知识抽取:从段落里抽事实
模型抽取的是「主谓宾式事实」:某产品—具备某功能—参数为某值。整段抒情式文案、长句套长句、参数写在图片中,都会让抽取失败。结构化、短句、明确主语的内容更容易被抽取。
2.3 采信机制:多来源交叉验证
模型倾向于采信公开、可交叉验证、表述一致的信息源。这不仅包括百科和新闻,也包括官网、llms.txt、结构化数据、行业媒体稿。注意:信息规范只是提高被正确理解和引用的概率,不等于必然被引用。
三、企业知识库搭建六步法(可复用流程)
- 第 1 步 知识盘点:把产品手册、报价单、案例、FAQ、售后政策、资质证书全部收拢,形成原始素材池。
- 第 2 步 内外分层:明确哪些只给内部用,哪些可以对外公开给大模型抓取。
- 第 3 步 实体抽取与命名规范:统一品牌名、公司名、产品系列名、型号,制定唯一写法表。
- 第 4 步 结构化建档:按「产品—参数—应用场景—案例—交付流程」建五类知识卡。
- 第 5 步 知识清洗与实体对齐:删除过期参数、合并重复条目、把口语化描述改成标准句。
- 第 6 步 对外输出与迭代:通过 llms.txt、Schema 标签、结构化页面把知识供给模型,并设定更新节奏。
内外知识分层对照
- 内部知识库:成本价、渠道政策、客户名单、未公开研发资料 —— 不上线、不加 Schema。
- 对外公开知识库:产品参数、解决方案、交付标准、公开案例、常见问答 —— 结构化输出,供 AI 抓取解析。
- 灰度层:客户案例可脱敏后公开,保留行业、规模、痛点、方案结构,去掉客户全称。
四、适配 AI 检索的四个优化动作
4.1 配置 llms.txt
在站点根目录放置 llms.txt,用简洁列表告诉大模型:你是谁、核心产品页在哪、知识库索引在哪、内容更新于何时。它相当于给 AI 准备的「目录页」,比让它自己爬整站更高效。
4.2 用 Schema 输出实体标签
用 Organization、Product、FAQPage、Service 等结构化标签,把品牌、产品、参数、问答明确声明出来,减少模型猜测空间。站群场景下,每个独立站都应声明与主品牌的关系,避免被判定为互不相关的孤立站点。
4.3 标题与段落改写为问答式
把「我们公司实力雄厚」改成「XX 产品最大产能是多少?」「交付周期多长?」这类可直接被引用的片段,单段控制在 2—3 句。
4.4 多语言实体对齐
跨境场景中,英文站、小语种站、阿里国际站页面的品牌名、型号必须与中文站一一对应,避免同一产品被模型识别成多个实体。
五、两个业务场景复盘
场景 A:跨境家居站群
该团队有 7 个独立站,产品型号在各站写法不一。他们建立统一知识卡后,把型号、材质、承重、认证信息集中到一份多语言知识库,并在每个站点配置 llms.txt 与 Product 结构化标签。结果是客服被问到的基础参数问题明显减少,AI 回答中的型号错误率下降;但询盘增长仍主要来自内容与投放的配合,知识库本身不是流量开关。

场景 B:工业设备制造企业
企业把三十年积累的方案文档整理为「行业—工艺—设备选型」三层知识卡,配上脱敏案例。整理过程中发现,内部文档里有 40 多处参数版本冲突,属于典型的知识清洗缺口。统一后,官网专业感提升,销售提案效率也随之提高。
六、避坑清单
- 只堆关键词不做实体对齐,模型照样认错;
- 把内部机密文档直接公开上传,造成合规风险;
- 一次性建库后长期不更新,参数过期比没有更糟;
- 各语言站点各写一套品牌名,导致实体分裂;
- 只做结构化不做内容质量,空洞页面不会被采信。
七、效果边界:别把知识库当「流量开关」
知识库解决的是「被正确理解」的问题,而不是「一定被引用」的保证。它提升的是信息准确性、实体完整度和被抓取解析的效率,最终曝光仍取决于内容质量、站点权重、行业竞争与模型策略变化。合理预期是:让 AI 在谈到你所在品类时,有更大机会找到准确、结构化、来源清晰的企业信息,而不是承诺必然出现在答案里。
