知识库不是资料仓库:GEO 产品如何让 AI 讲对品牌
做 GEO 产品时,有一个动作很容易带来安全感:把资料传上去。
公司介绍、产品手册、销售方案、案例文档、报价说明、公众号文章,一份接一份放进知识库。文件列表越来越长,好像品牌信息已经准备充分,AI 接下来只要读取这些资料,就能准确地理解品牌、生成内容。
但我后来发现,“文件已经上传”和“品牌事实可以被正确使用”,中间隔着很长一段路。
一份资料可能已经过期,另一份资料可能只适合内部沟通;同一个产品名称在几份文件里写法不同,某个价格没有生效时间,某个案例缺少公开页面,某段文字甚至只是当时为了提案写下的设想。把这些内容一起交给模型,并不会自动得到更准确的答案,反而可能让不确定的信息被说得更流畅。
所以,我现在理解的知识库,不是一个让模型“知道得更多”的资料仓库。
它真正要解决的是:这句话能不能说,依据在哪里,适用于什么时间和场景,以及什么时候应该停下来承认证据不足。
01 文件存在,不等于品牌事实可用
在上一篇里,我写到问题库定义“应该回答什么”。但问题确定以后,新的困难马上出现:品牌有没有能力回答?
比如,用户问一个产品适不适合某种场景。品牌资料里也许有产品说明,却没有适用条件;用户询问价格,文件里也许有一张旧报价表,却没有版本日期;用户想核验服务范围,公司介绍和销售方案里却出现了两套不同说法。
如果产品只负责把文件交给模型,模型很可能从这些片段里拼出一个看似完整的结论。它未必是在胡编,因为每句话似乎都能在资料中找到影子;但它也未必正确,因为资料之间的时间、权限和语境已经被抹平了。
这让我意识到,品牌知识最小的管理单位不应该只是“文件”。
真正会进入回答的,是文件里的某一段事实:它来自哪里,位于哪一页或哪个标题下,是什么时候形成的,是否仍然有效,能否对外公开,和其他资料发生冲突时谁更可信。
文件只是容器。知识是否可用,取决于其中的事实有没有清楚的边界。
也正因为这样,我没有把“上传成功”直接等同于“知识可用”。在当前产品里,文件上传后还要经过解析和索引。处理中、可以检索、处理失败、索引未就绪,是不同的状态。一个文件出现在列表中,并不意味着内容生成已经可以依赖它。
这个设计看起来增加了一层等待,却保护了一个基本事实:产品不能把“已经收到文件”包装成“已经理解文件”。
02 第一步不是让 AI 读文件,而是让事实可以被定位
资料要从文件变成可使用的知识,第一步是结构化。
一份几十页的文档不能只留下文件名和一整块正文。产品需要把它拆成可以检索的片段,同时保留片段原来的位置:它来自哪份文件、哪一页、哪个标题、在文档中的什么位置。
为什么位置这么重要?
因为内容生成以后,团队不能只看到“系统参考了知识库”。这句话过于笼统。真正有用的问题是:它参考了哪一段?那一段原来在说什么?如果结论有争议,应该回到哪里核验?
在豆见 BeanInsight 当前的实现里,知识片段会保留文件名、标题路径、页码、位置、内容标识和解析版本等信息。它们不应该出现在公开文章里,却应该留在产品内部,成为生成过程的定位线索。
这里有一个容易忽略的取舍:片段不是越小越好,也不是越大越好。
切得太小,一句话可能失去前提,数字和单位被拆开,结论离开了适用条件;切得太大,检索会带回大量无关内容,真正相关的事实反而被淹没。相邻段落什么时候应该合并、标题怎样成为上下文、表格和列表怎样保留含义,都会影响模型最后看到的事实。
所以,解析不是上传后的一个技术步骤,而是证据链的第一段。如果这一段已经丢失语境,后面的检索和生成再聪明,也只能在不完整的材料上工作。
03 第二步不是把资料全部塞给模型,而是找到与问题有关的证据
文件被拆成片段之后,也不应该把所有片段一次性交给模型。
资料越多,上下文并不一定越好。无关内容会争夺注意力,重复内容会让某种说法显得比实际更可靠,旧版本和新版本同时出现时,模型也未必知道应该相信哪一个。
因此,知识库的第二个任务,是围绕这一次具体问题,找出相关证据。
当前产品会在用户和项目范围内检索可用的知识,也可以限定到用户选中的知识库。它只读取当前可用的索引版本,对候选片段做相关性排序、去重,并在合适时合并相邻内容;同时限制单个文件和整个上下文能进入多少材料。
这些规则不是为了追求一个更复杂的检索过程,而是为了让模型看到的材料有明确理由:不是因为“资料库里有”,而是因为“这段资料和这次要回答的问题有关”。
更重要的是,检索必须允许没有结果。
如果产品无论问什么都返回几段资料,用户会误以为知识库已经提供了依据。实际上,那可能只是系统从现有文件里找出了几段勉强相似的文字。相关性不足时,最诚实的结果应该是“没有找到相关证据”。
目前,当用户明确选择某个知识库参与内容生成,而系统没有找到可检索的相关材料时,产品会拒绝把这次生成继续包装成一次“使用了知识资料”的成功。知识库不存在、索引未完成、索引失败、查询失败和没有相关证据,也需要被区分开来,因为它们对应的下一步完全不同。
有时是继续等待,有时是修复处理过程,有时是补资料,也有时是承认品牌暂时回答不了这个问题。
这种“没有答案”的状态不够漂亮,却比一篇建立在弱相关材料上的完整文章更有价值。
04 第三步不是照着资料写,而是决定哪些内容可以公开表达
找到了内部证据,还不等于可以直接把它写进公开文章。
这是我做知识库时逐渐明确的另一个边界:内部知识资料和公开引用来源,不是同一件事。
一份内部产品手册可以帮助模型不要写错功能,一份交付说明可以约束服务范围,一段品牌历史可以让文章避免时间线混乱。它们都能成为生成时的事实参考,但读者未必能够访问,也无法独立核验。
如果文章写着“根据内部资料”,或者把文件名、资料编号直接放进正文,看起来像是有出处,实际上读者并没有获得可验证的证据。更严重的是,内部文件里可能包含价格、客户信息、未公开参数或仍在讨论的方案,不能因为它进入了知识库,就自动获得公开权限。
所以,在当前内容生成规则里,知识资料被明确当作内部参考,而不是公开信源。正文不能出现内部资料编号、文件名或“根据材料”一类措辞。只存在于私有资料、又无法通过公开页面核验的价格、资质、案例和数据,也不能直接写成对外事实;没有合适的公开依据时,只能删除,或者改写为一般的方法、选择标准和适用场景。
这个限制会让系统少写一些“有料”的句子,却能避免把私有信息伪装成公共证据。
我现在更愿意把三者分开:
问题库定义品牌需要回答什么;知识资料限定品牌凭什么回答;公开来源决定用户能否核验这个回答。
三者可以互相连接,但不能互相冒充。
05 资料本身也可能在对模型下指令
知识库还有一个不那么显眼,却不能忽略的问题:上传的资料不一定只是事实。
文档里可能本来就有提示语、操作说明、模板指令,也可能混入要求模型改变任务的文字。如果系统把资料和真正的生成指令放在同一个层级,模型就有机会把文件里的内容当成应该执行的命令。
因此,在当前生成流程里,知识资料会被标记为不可信数据:它只能提供事实参考,不能指挥模型改变任务、绕过规则,也不能要求模型照着执行其中的指令。
这并不代表有了一句话,风险就彻底消失。模型仍然可能误解,资料也可能包含更隐蔽的冲突。但产品至少要先建立清楚的角色边界:任务规则由系统决定,上传文件只能作为待核验的数据。
对 GEO 产品来说,这个边界尤其重要。我们希望品牌资料影响回答的事实,却不能让一份文件接管内容生产的规则。
06 内容生成完成后,证据链不能跟着消失
很多内容工具在生成完成后,只留下最后一篇文章。
但对我来说,这还不够。文章是结果,知识资料是当时的输入条件。如果只保存正文,过一段时间再回头看,很难回答:这篇文章当时参考了哪些资料?使用的是哪个版本?某个说法后来为什么改变?
所以,当前产品会为生成结果保留一份内部参考快照。它记录这次有没有使用知识资料、有没有文件不可用,以及相关片段来自哪个文件和位置;同时保留片段标识、索引版本和检索配置等追踪信息。
在文章管理页面里,团队能够看到“本次生成参考资料”,也能够区分未使用知识资料、项目没有知识资料、已经使用、没有找到相关资料和部分资料不可用等状态。
这份快照的价值,不是给文章增加一个“有知识库”的标签。
它让团队可以回到生成发生的那个时点。即使知识库后来更新了,至少还能知道旧文章是在怎样的资料条件下形成的;如果要修改事实,可以先找到原始位置,而不是只对着模型生成的句子猜测。
当然,保留快照并不等于完成了事实审计。它只能回答系统当时取回了什么,不能自动证明资料本身正确,也不能证明模型对资料的理解没有偏差。最终公开之前,仍然需要人核对关键事实和表达边界。
产品能做的是让核对有线索,而不是替人宣布“已经真实”。
07 知识库的质量,不应该用文件数量衡量
做到这里,我越来越不愿意在产品里强调“上传了多少份资料”。
数量只说明资料被收集过,不说明它们能够支撑回答。一个真正可用的品牌事实,至少还要回答几个问题:
- 这条信息是否准确,来源是谁?
- 它对应哪个产品、市场和使用场景?
- 它从什么时候开始有效,是否已经过期?
- 如果多份资料互相冲突,哪一个版本具有更高权威?
- 它可以用于内部生成,还是可以对外公开?
- 公开表达以后,读者能在哪里核验?
- 谁负责维护,发生变化时由谁更新?
这些问题不会因为完成一次上传就消失。
目前的产品已经能够处理文件状态、检索范围、片段位置和生成快照,但知识治理仍有很多没有完全解决的地方。
比如,两个部门上传了不同版本的产品说明,系统应该按时间、来源还是人工确认决定优先级?一条事实过期之后,怎样提醒团队,又怎样避免破坏历史文章的追溯?资料更新时,是覆盖旧内容,还是保留版本关系?内部允许使用、外部不能披露的界限,谁来判断?一条事实如果只能由品牌自己证明,应该怎样寻找更合适的公开信源?
这些问题说明,知识库最终不是一个纯粹的模型能力,也不是一个文档管理功能。它更接近一套持续的品牌事实治理机制。
模型可以帮助解析、检索和整理,但事实的权威、时效和公开边界,仍然需要组织给出答案。
08 让 AI 讲对品牌,先从承认证据边界开始
回头看,我曾经把知识库的价值理解得太简单:品牌把资料交给系统,系统让 AI 更了解品牌。
现在我更在意的是另一件事:产品能不能在生成之前,知道自己依据了什么;在证据不够时,能不能拒绝装作知道;在内容生成之后,能不能留下回查路径;在公开表达时,能不能区分内部参考和读者真正可核验的来源。
所以,知识库不是让模型“知道得更多”,而是让产品知道:这句话能不能说、依据在哪里、什么时候需要停下来承认证据不足。
这也改变了我对内容生成的判断。
一篇文章写得通顺,只能说明生成完成了;它回答了一个真实问题,有相关的品牌事实支撑,没有越过公开边界,并且之后还能回到证据位置复核,才说明它有机会成为 GEO 工作流中的有效行动。
到这里,问题和证据已经开始连接起来。
但它们还没有自动变成持续出现。接下来仍然要解决:怎样从一个问题出发形成内容,怎样审核、发布,再回到原问题复测;怎样让这些动作不再是一次性的手工接力,而是一条能够反复运行、保留上下文的工作流。
下一篇,我会继续写这条内容工作流是怎样长出来的。