楼主
我先说吧,我认为应该翻译为“偷啃”,原因如下
————————————————————————
一、“偷”:抓取核心特征
1.在Transformer架构中,模型处理文本时并不是逐字死记硬背,而是通过注意力机制(Attention)去捕捉(偷)关键的语义权重。
2.为什么强调“偷”,因为数据都是互联网给喂的,说白了,我发的信息我让你Ai拿了吗,你就给自己训练注意力权重?
————————————————————————
2. “啃”:反复咀嚼与迭代
1.大模型生成答案是自回归的,一个字一个字往外蹦,每次生成都要参考前面所有的内容,以及整体的上下文。
2.对于目前模型能力来说,都有“推理强度”设置,在我看来,设置“低-Low”和设置“极高-Xhigh”,本质上就是他“啃”上下文的次数不一样,听懂掌声👏👏👏
————————————————————————
因此在我看来,“偷啃”这个词,能够生动的反应出来,当前在Transformer架构中,Ai生成回答的原理,如果用“偷啃”翻译“token”,技术人员脑海中浮现的不是冰冷的数字,而是一个贪婪、耐心且略显笨拙的AI在后台默默处理数据的画面。