最近在研究一个我觉得挺有意思的问题:
现在很多 LLM 应用遇到信息不完整、存在歧义的时候,往往还是会直接“猜一个答案”。
但真实业务里,很多时候我们并不希望 AI 猜。
比如:
“王老师说下周四 8:00 到单位,具体讨论时间看你安排。”
这里其实存在很多不确定性:
- 8:00 是见面时间,还是她到单位的时间?
- 应该直接创建 8:00 的日程吗?
- 还是应该先追问确认?
所以我最近做了一个小项目:Jev AI Playground。
目前主要想实验三种 primitive:
- Live Choice:让 AI 在几个候选项之间做结构化选择
- Noul:处理信息不足、歧义和需要进一步确认的情况
- Score:对候选结果进行评分
我的想法不是再做一个 ChatGPT 套壳,而是尝试把 LLM 的一些“不确定决策”从自由生成里拆出来,变成更容易控制和验证的流程。
现在做了一个可以直接体验的 Playground:
Jev AI Playground: https://tryjev.ai/
目前还是比较早期的版本,主要想验证:
- 这三种 primitive 是否真的容易理解;
- Playground 能不能让开发者快速理解 Jev 在解决什么问题;
- 哪些真实场景最适合这种方式。
如果你平时也在做 Agent / AI Workflow / LLM 应用,很希望听听大家的意见。
尤其想知道:
你们实际开发 AI 应用的时候,有没有遇到过“模型不应该猜,而应该停下来判断 / 追问”的场景?
欢迎拍砖。