已发布约 3 分钟
LLM 时代的知识工程:从文档管理到可操作的知识系统
当大语言模型成为知识的主要消费者之一,知识工程的对象、方法和评价标准都在变化。本文给出一个面向人机共读的知识系统框架。
目录
传统知识管理的核心问题是”存起来找不到”,而 LLM 时代的核心问题变成了”找到了用不好”。这篇文章讨论这个转变,以及它对个人和企业知识系统设计的含义。
从”图书馆”到”工作台”
图书馆式知识系统的假设是:用户知道自己要找什么,找到之后自己会读完。这个假设在两种情况下失效:
- 使用者的先验不足——新手不知道该检索什么;
- 使用者不是人——LLM 没有”自己去读完”的耐心概念,它只接受被裁剪好的上下文。
因此知识系统的基本单元需要重新设计。与其问”这篇文档放在哪个文件夹”,不如问:
- 这条知识解决什么问题?(问题锚点)
- 它在什么条件下成立?(适用边界)
- 它和哪些概念相互依赖?(关系网络)
一个三层框架
我把面向人机共读的知识系统分成三层:
原始材料层保存来源:论文、会议记录、现场观察。概念层把材料抽象成稳定的概念和关系。决策层面向具体问题,把概念组合成行动依据。LLM 在概念层读写,人在决策层判断——这是我认为比较合理的人机分工。
一个微小的实证
我在自己维护的三类内容上做了对比:传统文件夹笔记、带主题聚合的数字花园、以及为 LLM 裁剪过的结构化摘要。让同一个模型回答 20 个需要跨文档综合的问题,结果如下(示例数据):
结构化摘要明显胜出并不意外:它本质上是为模型”预制了上下文”。真正值得注意的数字是数字花园也显著优于文件夹——只要存在显式的主题聚合,机器的可用性就大幅提升。
对个人网站的含义
这也是本站采用 Topics 作为一等公民的原因。Topic 不是标签,而是知识系统里的”概念锚点”:文章、笔记、阅读记录和项目都挂接到主题上,主题页自动聚合出一个小型知识视图。
局限与下一步
这个框架目前有三个未解决的问题: