你到底该用哪个 AI?我做了一个 AI 来回答这个问题。
TL;DR
公司里大多数人只用到了 Claude、ChatGPT 或我们内部的 MemodoAI 等工具能力的一小部分。给权限、发教程都解决不了这个问题。于是我做了 Sherpa:一个开源 agent,它就一个人的工作进行访谈,告诉他们哪些 AI 功能真正适合他们的实际工作,附带操作方法和一个保守的省时估算,然后请他们承诺去试用其中一个。它以 LangGraph 应用的形式运行,背后是一个兼容 OpenAI 的 endpoint,跑在 open weights 上,并带有一个 eval harness。
问题
我做了 MemodoAI,它是 LibreChat 的一个 fork,目的是给全公司提供一个 AI 聊天机器人和一批 agent,而不必按席位付订阅费。之后我让 Claude 制作了一个 18 分钟的入门教程。两者都有帮助。但都没有解决根本问题,这个问题我早在 MemodoAI 之前就看到了:大多数人只把 AI 工具用在它们能力中很窄的一块上。改写一封邮件、做个摘要,仅此而已。
瓶颈不在于权限,也不在于说明。缺的是「工具能做什么」和「某个人每天具体做什么」之间的那条连接。教程讲的是功能。它不会告诉一位 controller,这些功能里哪些适用于他的月末结账。
Sherpa 做什么
Sherpa 就一个人的工作进行访谈:重复性任务、他们用的系统、在哪里浪费时间、哪些东西要手动重新录入。它给出三到五条建议。每条都点名一项具体的 AI 能力(在 MemodoAI、Claude 或任何已获批准的工具里),说明如何把它应用到这个人的工作流程中,并给出一个保守的省时估算,同时讲明所依据的假设。最后它请这个人承诺去试用其中一条。
访谈进行时并不加载工具目录。这是有意为之。如果 agent 在提问时就知道菜单,它就会把问题往自己已经能满足的需求上引导。盲着来,它就必须先把工作摸清楚,然后才在一个单独的阶段里去和目录做匹配。这也让它能报告缺口:背后没有好工具的真实需求,它们会告诉你接下来该自己造什么或买什么。
一个能规模化的私人顾问
Sherpa 提供的是那种通常需要顾问的指导,需要有人坐在每位员工旁边,把他们的工作和现有的能力对应起来。这种做法无法规模化,所以大多数公司从来不做。但 Sherpa 是软件,所以同样量身定制的对话可以同时对所有人进行,想做多少次都行,包括每次有新工具或新能力出现的时候。
自上而下的命令和面向全员的培训做不到这一点。当有人向人们展示 AI 如何契合他们自己的工作时,他们才会采用它,而 Sherpa 可以一次性为所有人做到这件事。
它是怎么构建的
Sherpa 是一个 LangGraph 应用,包含三个节点(diagnose、match、commit),以及一个带类型的 state 对象,在它们之间传递一个结构化的 needs profile。它运行在一个轻量的 FastAPI 兼容 OpenAI 的 endpoint 之后,因此以后可以不用重新接线就接入 MemodoAI。推理通过 Together AI 跑在 open weights 上。LangSmith 负责 tracing 和 eval。这些建议是在代码里从一个结构化的 JSON 对象组装出来的,而不是由模型自由撰写,这让输出格式保持稳定、质量可以被检查。
现状
这是一个 proof of concept。范围是有意收窄的:一套财务岗位的问题库、单个用户、一个本地的承诺日志,而不是覆盖全组织的度量层。这个 POC 的意义在于,在围绕它构建任何东西之前,先验证这些建议是否足够具体、是否真的有用。已知的局限和被推迟的路线图都在 repo 里。
它能解决什么
Sherpa 覆盖了组织通常当作彼此独立来处理的几个 AI 采用环节:
- 发现:AI 在某个具体岗位上能在哪里帮上忙。
- 采用:让人们去用那些已经存在的工具。
- 度量:哪些建议在公司里真正被采用,好让你看到 AI 到底在哪里产生了回报。这不是生产力监控。Sherpa 统计的是建议,不是人。它不追踪谁在用 AI、谁没在用,也不给任何人的个人产出打分。没有按人划分的看板。度量采用情况、而不是度量个人,也正是让它处在职工委员会和 GDPR 边界之内的原因。
- 自我改进:每一次对话都会产生信号。人们承诺了什么、什么省了时间、估算在哪里跑偏了、哪些需求没有工具。eval harness 会捕捉这些;把它们回灌进去,它就会调整问题库、匹配和估算。这种调整现在还是我手动做的。等到有了足够多的真实使用量,一个监督型 agent 就可以来跑它、重新扫描新的工具能力,并把两者都回灌进去。
试试看
它是开源的。最清楚地反映真实状态的是 SDD/ 目录:构建背后的规格说明和批判性评审,也就是我之前写过的那套规格驱动的流程。