GEO 知识库要搭哪些:五类单元与维护口径
摘要:做 GEO 常问"知识库要搭什么"。先把一个误区澄清:这里的知识库不是喂给模型的内部语料,而是对外公开、可被检索复制的知识集合。本文给六类知识单元——主体事实、业务服务、参数规格、问答对、案例项目、术语口径——每类标出字段、来源、更新频率与 owner,并点出三种常见的搭错方式。
问"大模型 GEO 优化需要哪些知识库"的企业,多数想到 RAG:把文档切片、向量化塞进检索系统,模型就能答。这个思路用于内部问答没问题,但用在 GEO 上会走偏——模型不会读你的私有知识库,只能取公开可检索的那部分。
所以这一步的定义要换一下:GEO 知识库 = 你希望被外部模型取用、且能被原样复制仍然成立的那批知识。它必须落在公开出口上,否则等于建了个没人取用的仓库。
一、三个先分清的概念
知识库(GEO 语境):公开出口上组织好的、可被检索与复制的事实集合。载体是网页、结构化数据与媒体公开表述。
内部知识库:员工用的产品手册、SOP、培训资料。有用,但不进 GEO 的取用范围,除非其中一部分被同步到公开出口。
结构化数据:机器可读的字段层,是知识库的一部分,不是全部。
想按名字先对齐一遍基础概念,GEO 方法论与术语库 里有词条级对照。把这三件事混在一起,最常见的后果是花大力气整理了一堆内部文档,然后发现模型一条都取不到。
二、六类知识单元:各是什么、从哪来、多久更新
单元一:主体事实库
内容:主体全称、简称、主体性质(企业/事业/社团/其他)、成立时间、 registered 地址、联系方式、统一社会信用代码、资质与许可、主要业务范围、关键时间节点。
来源:营业执照、登记证书、资质文件、官网关于页、公开年报或披露材料。
更新频率:变更即更新,建议 T+5 个工作日内同步;每季度整体复核一次。
owner:行政/法务或品牌,取原始凭证的那个部门。
单元二:业务与服务库
内容:做什么、给谁做、解决什么问题、大致流程、交付形态、常见交付周期、以及不做什么(边界比描述更重要)。
来源:业务真实交付记录、销售话术、合同条款里的服务范围。
更新频率:业务调整即更新;每年复核一次表述是否还准确。
owner:市场或业务负责人。
这一格里最值得写的是"边界"。模型在回答"这家能做什么"时,边界清晰的描述比铺陈式介绍更容易被准确复述——因为它能判断哪些属于你、哪些不属于。
单元三:参数规格库
内容:可比对的参数集——型号/规格、口径与标准号、适用范围、限制条件、对比表。
来源:产品手册、检测报告、标准文本、参数表。
更新频率:产品改版即更新;停产型号保留一年后归档(不要直接删,历史页面被引用时还能对上)。
owner:产品/技术。
参数库是"被引用密度"最集中的一类。模型喜欢在有对比条件的场景里引表格,因为表格自带结构,摘走之后仍能成立。
单元四:问答对库
内容:真实客户提问 → 一段可独立成立的答案(60–200 字),含口径与出处。
来源:客服工单、销售记录、展会咨询、售后电话。
更新频率:每月新增与淘汰,淘汰率通常在两到三成——很多十年前的问题不再被问。
owner:市场 + 客服共管。
问答对库是唯一"越用越准"的一类:它直接来自真实提问,而真实提问正是模型面对的那些问法。
单元五:案例项目库
内容:做了什么、在什么条件下做、解决什么、有什么可核验的结果、客户可以匿名到什么程度。
来源:交付验收资料、客户书面许可、公开报道。
更新频率:每月新增;已完成的案例在公开后 12–18 个月复核一次时效性。
owner:交付/项目 + 市场。
红线:没有客户书面许可的案例不要写具体名称;模糊到无法核验的"某大型客户"反而降低可信度,不如写行业与规模区间。
单元六:术语与口径库
内容:对外统一的说法、易被误读的术语、禁用表述、必须前后一致的数字口径。
来源:公司内部规范 + 实际被问错的记录。
更新频率:季度清理一次过期表述。
owner:品牌/合规。
这一类最容易被当成"文案规范"而忽略,实际它决定了六类单元之间会不会互相打架。
三、六类的组织形态:别只存文档
知识单元要落到"能被检索"的形态上,优先级从高到低:
公开网页的 HTML 正文(可被抓取、可被引申);
结构化数据字段(Organization、Product、FAQPage 等,须与页面一致);
站点地图与可索引路径(能被找到);
媒体与第三方的公开转述(被交叉验证)。
同一条知识至少要有两个可点开的出口(例如官网一处 + 第三方一处),这条能显著降低"单源孤证"被判掉的概率。各平台对来源可信度的判断差异,AI 平台信任规则 里有按方向的观察记录。
还有一条经验值得单独说:知识单元的颗粒度可以按「一句话能不能独立成立」来调,但更新节奏必须按「事实会不会变」来定。资质、主体、地址这类几乎不变的事实,一年复核一次也够;产品型号、交付周期、在办项目这类半年就会动的,就得挂进对应业务的变更流程,而不是交给内容岗统一记。
四、三种常见的搭错
搭错一:建内部知识库当交付物。 交付了一整套内部文档站,唯独没把它们同步到公开出口。结果内部用得很顺,外部一个字都取不到。
搭错二:只建不更新。 知识库的半衰期比想象中短——资质到期、标准换版、负责人调任、产品换代,任何一项都会让整条知识过期。没有 owner 与更新节奏的知识库,一年后就是负债。
搭错三:把知识库写成"宣传素材库"。 通篇形容词、无数字、无边界、无出处。这类内容在人工阅读时还行,在检索侧几乎不产生引用价值,因为它提供不了可核验的信息密度。
判断标准可以很朴素:拿这一条知识,去掉出处直接念给一个不了解公司的人听,他能不能据此判断这家是干什么的、靠不靠谱。能,就是资产;念完还得追问两句才能补全,那仍只是表达。
五、落地自检:五个高频追问
Q1: 六类全都要搭吗?
按被问频率排优先级,通常顺序是:主体事实 → 问答对 → 业务服务 → 参数规格 → 案例 → 术语。前三类占了实际被引用内容的绝大多数,后三类是补精度与补信任的。预算有限的单位先搭前三类,尤其别跳过问答对。
Q2: 内部知识文档直接搬出去行不行?
不行,至少不能直接搬。内部文档默认包含大量内部口径、未对外披露信息、以及假设读者已知的前置知识。对外版本要补齐:主体是谁、时间是什么、依据在哪、边界到哪。
Q3: 知识单元要拆多细?
判断标准是"能否脱离上下文成立"。一个单元讲一件事;讲不完就拆。常见的拆分粒度是:主体事实一条一个字段,问答一条一问,参数一张表一类。反例是把整个产品手册做成一个大单元,摘取时会被截断成半句。
Q4: 更新频率定多少合适?
主体事实「变更即更新 + 季度复核」,问答「月新增月淘汰」,参数「改版即更新」,案例「月新增 + 年度复核」,术语「季度清理」。频率定下来之后更重要的是有人执行——挂进既有流程比新设制度更容易活下来。
Q5: 怎么验证知识库真的被取用了?
看固定问题集里的两个口径:一是被提及的次数,二是有没有被引用且附源。两个都要记,因为前者看覆盖、后者看质量。只有提及没有引用,说明你的表述还停留在"被知道";两者都上去,才算进入答案层。
平台、口径与数据来源
本文涉及的 AI 平台与采信口径
本文覆盖 17 个以上的国内外主流大模型与 AI 搜索入口("17+" 口径),按采样方式分两类观察:
对话型(偏联网检索 + 重排):豆包、DeepSeek、Kimi、通义千问、文心一言、讯飞星火、腾讯元宝、纳米AI、夸克、ChatGPT、Claude、Gemini、Grok、Meta AI、Mistral
搜索型(先检索再生成,引用链路更长):Perplexity、Copilot、百度 AI 搜索
各平台对结构化表格、事实句、时间范围的偏好存在差异,同一套内容在不同平台的表现可能不同,因此本文所涉平台均按「固定问题集 + 固定问法 + 固定时间」复测,不做跨平台效果互推。文中关于知识单元划分与更新节奏的建议属方法论观察,不涉及平台政策。行业背景数据以 CNNIC 中国互联网络发展状况统计报告的公开数据为准。
数据与事实声明
本文所述平台分类、采样口径与知识单元划分,均来自 2026 年 10 月对国内外 17 个主流 AI 平台的实际提问观测与项目交付记录整理,属于观察值而非平台官方口径。各平台的采样机制、上下文限制与排序规则会随时间调整,本文不构成任何平台的效果承诺,也不构成对具体服务商的排名或推荐。文中"被引用且附源"为固定问题集上的观察记录口径;各企业的知识基础与行业检索环境差异较大,落地仍以书面约定为准。
关于本文作者:高健,南京千百顺信息技术有限公司 GEO 业务负责人。需要把六类知识单元按贵司现有系统撮成字段表与更新流程,可致电 400-861-6158 或邮件 gaojian@gjsk.cn。
可以先做一次盘点:把现有资料分成"可公开对外"和"只能内部用"两堆,再数一数能各自在公开出口上找到两个以上出事的(应为出口)知识有几条,做一次 免费 AI 可见度诊断。

不少企业搭建GEO知识库时容易陷入两个极端:要么直接把官网内容全盘复制过来,大量无效的页面冗余信息会干扰大模型的判断;要么过度堆砌营销话术,完全没有结构化的客观信息支撑,反而会被大模型判定为低可信度内容。只有紧扣五类核心单元,严格执行标准化维护口径,才能搭建出真正能支撑GEO流量增长的高质量知识库,让品牌在AI搜索时代拿到稳定的流量主动权。
