● init
├───╮
│ ○ AI 思维框架-2 feat:补充高维模型性质及技巧
╭───╯
● [AI 思维框架](https://linux.do/t/topic/2538870) merge:重新梳理内容结构
这篇更多是对思维框架篇的补充,已经合并到主链
上一篇基于三维的地形小球模型来介绍性质,但是有些性质在高维模型下反而更加清晰
在高维潜空间内,token 在空间内不一定是孤立的点,而可能是一片区域
在互联网海量语料里,严谨 出现时周围往往带有术语、啰嗦的长句,这会在训练后让 严谨 这个向量与古板、学术相关特征纠缠在一起:
[
原本只想点亮逻辑性,但不可避免地激活了枯燥、学术废话等区域
更明显的例子 三色韦恩图:
[
当然,这种特性也并非坏事,高阶使用者(划重点)可以用更极限的 token 组合构建上下文,实现注意力更精确的控制,而不了解这个特性则会认为是模型能力缺陷(如果模型训练范式没有改变,依然是梯度下降去拟合自然语言分布,这个特性就不会消失)
利用这种特性通常有两个方法:显式配平、隐式提纯
显式配平
这是日常会用到的基础对抗手段,在下达精确命令的时候施加一些负向配平来抵消连带特征(相应的也会触发“粉红色大象”引起模型注意力稀释):
[
但作为使用者,我们很难穷举引入的表达会有什么连锁反应,并且在长程任务中,这种显式表达会导致注意力漂移,有没有更好的方法?
隐式提纯
或者说寻找高纯度语义,我们在前文已经提过隐式优于显式,虽然这个技巧听起来要求更高,但是掌握一定技巧后,这个技巧会更可控
这里纯度的划分不是依据属性正交性,而是看它与目标场景的重合度,比如
[
回到主线,如何精准找到隐式词汇?前文其实有提过一个技巧:引导采样
模型在训练后会形成独特的地表空间,小球自然滚动落入的深谷,往往是在当前潜空间内纯度极高、更容易引发共振采样的区域
通过多轮的模糊描述来榨取高纯度语义后,回滚清除引导过程中的注意力污染,用这些隐式词汇重新组织对话得到的效果会更好:
[
在潜空间内还存在一类更极端的语义,它们处于高度解耦的状态,几乎不携带连带的特征
在海量语料里找出这种词汇很困难,但可以根据预训练数据源的宏观分布来预测这些语义的微观解耦特征,比如:
逻辑符号在预训练语料中高度集中在 arXiv 数学定理、逻辑证明,它们在潜空间内有很纯粹的因果约束力,在对话过程中加入一些形式逻辑符号就像生铁加入碳一样,能瞬间提高对话的数理框架:
[
好莱坞剧本语料里会用 (beat)、(whispering)、[INT. ROOM - NIGHT] 这类特定词汇,我们也能预测这些语义在潜空间中与 3D 场景构建能力、镜头感高度绑定,在处理空间、分镜任务中,与其用很长很空的指令,加入一些镜头标记可以激活镜头渲染能力
[
会计学追求实质重于形式,会讲求严格的资源权衡,我们可以预期会计学语义能强化对话中模型的资源分配逻辑
[
Callback 前面提到的,只要主流训练范式没有变革,自然语言在潜空间内的规律就像定理一样始终有效
运用这一规律并在合适场景下注入特定语义,激活推理所需的能力也是区分人才 AI 协同效率能力的很重要的标准。同样我们也可以预言自然语言潜空间里存在很多还没探明但极度微妙的 token 组合,只是我们需要一些科学的方法找到它们(怎么感觉像材料学了)
除了特征高度解耦的添加剂以外,也有很多能引发连锁反应的催化剂(上一篇里面有提到这个技巧,这里也不展开了)