大模型输出聊天内容的原理还是了解一点的,对于模型进行计算这个环节,不知道模型内部还是和自然语言一样,从高维向量空间中,按概率取值?还是其实模型内部其实也内置了很多 tools / function call 这样的工具?
1
Rickkkkkkk 4h 8m ago 会自己现写 python 脚本来算
|
2
ywcjxf1515 3h 51m ago
按照概率来的吧
|
3
ywcjxf1515 3h 50m ago
@ywcjxf1515 比如 deepseek 官网 你要他 1+1 也行啊
你又没设置工具 |
4
fds 3h 31m ago
对普通大语言模型来说,“聊天”和“计算”在底层并没有一道明确的分界线,基本都是同一个过程——根据已有上下文,计算下一个 token 的概率分布,再选择一个 token 输出。人其实也一样,为什么要背九九乘法表呢?也不过就是把三七后面说二十一的概率提高而已。
当然对于很复杂的问题,也会训练 llm 调用工具。比如让 kimi 算 24 点,它会编写 python 程序并执行。这一般会显示在聊天记录中。 |
5
jacketma OP @ywcjxf1515
@fds 文字预测 token 输出本质是概率分布,计算行为的差别是精确行为,理论上必须 100%确定。 而计算的行为本身的分布是无穷大的,没办法压缩或重整化,所以我推测应该不纯靠概率分布输出。 有懂原理的大佬执教 |
6
nakun233 3h 26m ago
这个个人写死一定要跑程序算,不然太傻了
|
7
106npo 3h 22m ago
如果 llm 没返回 tool_call 那就是根据概率直接推的,至于对不对 那就看概率了.你不给 llm tool ,然后让它算一个复杂的式子,他也会回答你,但正确率就和随口一说一样了
|
8
hachimen 3h 18m ago
是的,在线模型已经内置了最基本的工具调用。你是对的。
|
9
TArysiyehua 3h 17m ago
@jacketma 所以大模型经常算错呀,之前大模型,随便问它简单的计算,它都算不准。后来就跟楼上说的那样,给它加了 tools 跟 function ,现在它会自己调用这些工具得到精准的结果
|
10
sentinelK 3h 16m ago
这个要取决于大模型的心情。tool 都摆在那里,他决定用工具就会用,否则就是概率累计。
概率推算确实不精准,比如之前很流行的 9.9 和 9.11 谁大。 但是目前据我观察,即便是概率硬猜也没再出现那种初级错误了。 估计是后训练有一些针对性优化。 |
11
sillydaddy 2h 44m ago
大模型里面,不是只有线性层的,还有非线性层。一说概率,脑子里就是 xx 出现的概率,xx 和 yy 的联合概率,xx 和 yy 和 zz 的条件概率!所有这些都是臆想!没人懂这些非线性层!
|