11模型与架构
学出来的模型长什么样:Transformer、VLM、动作怎么生成、VLA 和世界模型。 · 184 条
- 11.1神经网络基础16
- 11.2从注意力到大语言模型24
- 11.3视觉编码器与视觉语言模型28
- 11.4生成模型入门10
- 11.5扩散模型与流匹配22
- 11.6动作怎么表示和输出17
- 11.7VLA 的结构与扩展17
- 11.8分层系统与具身推理12
- 11.9世界模型与视频生成23
- 11.10推理加速、部署与可靠性15
11.1神经网络基础
从最基本的神经网络零件和经典结构学起,后面所有模型都用它们搭成。
- 神经网络Neural Network (Deep Neural Network)由大量人工神经元分层连接、靠调整连接权重从数据中学习的模型。
- 参数量Parameter Count (Model Size)模型里可训练数值(权重)的总个数,常用 B(十亿)、M(百万)表示。
- 多层感知机Multilayer Perceptron由多层全连接层加非线性激活堆起来的最基础的神经网络。
- 激活函数Activation Function (ReLU / GELU / SiLU / SwiGLU)接在每层线性变换后的非线性函数,让网络能拟合复杂关系。
- Softmax(归一化指数函数)Softmax把一组任意实数变成全为正、加起来等于 1 的概率分布的函数。
- 归一化层(层归一化 / RMSNorm / 批归一化)Normalization Layers (LayerNorm / RMSNorm / BatchNorm)把网络中间特征拉回稳定数值范围的层,让深层网络训练更稳更快。
- 卷积神经网络Convolutional Neural Network用小卷积核在图像上滑动提取局部特征的神经网络,长期是视觉任务的主力。
- 残差网络Residual Network用跳跃连接让每层只学输入与输出之差,从而能训练很深的卷积网络。
- 骨干网络Backbone Network模型中负责从原始输入提取通用特征的主体网络,后面再接各种任务头。
- 谷歌提出的高效卷积网络系列,按统一比例同时放大深度、宽度和分辨率。
- 循环神经网络Recurrent Neural Network按时间步逐个处理序列、用隐藏状态记住过去信息的神经网络。
- 长短期记忆网络 / 门控循环单元Long Short-Term Memory / Gated Recurrent Unit带「门」的循环神经网络,能记住较长的历史信息,常用来处理时间序列。
- 编码器-解码器Encoder-Decoder先把输入压成中间表示,再由另一部分据此生成输出的网络结构。
- 归纳偏置Inductive Bias模型或算法预先内置的假设,决定它如何推广到没见过的数据。
- 等变策略 / 等变网络Equivariant Policy / Equivariant Neural Network输入旋转或平移时,输出按同样方式变化的网络,把对称性写进结构里。
- 图神经网络Graph Neural Network专门处理图结构数据的神经网络,每个节点通过边和邻居反复交换信息。
11.2从注意力到大语言模型
大模型的共同主干:token、注意力和 Transformer,再到大语言模型。
- token(词元)Token模型处理数据的基本单位,文字、图像小块、动作都能切成 token。
- 分词器Tokenizer把文字、图像或动作切成 token 并换成整数编号的预处理模块。
- 字节对编码Byte-Pair Encoding反复合并最常见的相邻符号对来构建子词词表的分词算法
- 嵌入向量Embedding把词、图块、动作等对象表示成一串实数,意思相近的东西向量也相近。
- 注意力机制Attention Mechanism让模型按相关程度给输入的各部分分配权重,再加权汇总信息的计算方法。
- 自注意力Self-Attention让序列中每个元素参考同一序列其他元素、按相关度汇总信息的机制。
- 交叉注意力Cross-Attention让一组 token 去查询另一组 token 里信息的注意力,是跨模态融合的常用接口。
- 以注意力机制为核心的神经网络架构,是大模型和 VLA 的共同主干。
- 位置编码Positional Encoding给 Transformer 里每个 token 加上「我在第几个位置」的信息。
- 旋转位置编码Rotary Position Embedding把位置信息写成向量旋转角度的位置编码,让注意力天然感知相对距离。
- 因果注意力Causal Attention每个位置只能看自己和前面的内容,看不到后面的注意力。
- 注意力掩码Attention Mask规定序列里每个 token 能「看到」哪些 token 的矩阵
- 基础模型Foundation Model在海量数据上预训练、之后能适配到许多下游任务的大模型。
- 大语言模型Large Language Model用海量文本训练、能理解和生成自然语言的超大神经网络。
- 自回归解码Autoregressive Decoding一个接一个地生成输出,每一步都以前面已生成的内容为条件。
- 解码策略(贪心 / 温度采样 / Top-k / Top-p)Decoding Strategies (Greedy / Temperature / Top-k / Top-p Sampling)模型给出下一个 token 的概率分布后,决定具体选哪个 token 的规则。
- 仅解码器架构Decoder-only Architecture只保留 Transformer 解码器、用因果注意力逐个预测下一个 token 的模型结构。
- LlamaLlama (Meta large language model family)Meta 发布的开放权重大语言模型系列,常被拿来当各类模型的语言底座。
- 混合专家模型Mixture of Experts模型里放多个「专家」子网络,每次只激活其中几个,用少量计算换大容量。
- 提示词 / 提示工程Prompt / Prompt Engineering提示词是输入给模型的文字;提示工程是设计它以得到想要输出的方法。
- 思维链Chain-of-Thought让模型先一步步写出中间推理过程,再给最终答案。
- 上下文长度Context Length模型一次最多能处理的 token 数,决定它能同时「看到」多少输入
- 状态空间模型State Space Model用一个随时间更新的隐藏状态处理长序列的网络,计算量随序列长度线性增长。
- MambaMamba (Selective State Space Model)用随输入变化的状态空间模型替代注意力、计算量随序列长度线性增长的序列模型。
11.3视觉编码器与视觉语言模型
给语言模型装上眼睛:先看图像怎样变成 token,再看 VLA 的底座 VLM。
- 视觉编码器Vision Encoder把图像转成一组特征向量(视觉 token)供后续模型使用的网络。
- 视觉 TransformerVision Transformer把图片切成小方块当作词序列,用 Transformer 处理图像的网络。
- 视觉 tokenVisual Token图像切块并编码后得到的一个个向量,是模型处理图像的基本单位。
- 视觉基础模型Vision Foundation Model在海量图像上预训练、能直接或稍加调整用于多种视觉任务的通用模型。
- CLIPContrastive Language-Image Pre-trainingOpenAI 用 4 亿对图文训练的模型,把图片和文字映射进同一个向量空间。
- SigLIPSigmoid Loss for Language-Image Pre-training谷歌用 Sigmoid 损失训练的图文模型,其图像编码器被许多 VLA 采用。
- DINOv2DINOv2 (self-DIstillation with NO labels, v2)Meta 2023 年发布的自监督视觉模型,不用标注就能学出通用图像特征。
- DINOv3DINOv3 (Meta self-supervised vision foundation model)Meta 2025 年 8 月发布的第三代 DINO,70 亿参数、17 亿张图自监督训练。
- Florence-2Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks (Microsoft)微软开源的小型视觉基础模型,用文字提示切换描述、检测、分割等任务。
- 预训练视觉表征Pre-trained Visual Representation在大规模图像或视频上预先训练好的视觉编码器,拿来给机器人策略当「眼睛」。
- 空间 SoftmaxSpatial Softmax (Keypoint Pooling)把卷积特征图每个通道汇聚成一个「最亮点」的二维坐标,保留物体位置信息。
- 文本编码器Text Encoder把文字指令转换成向量序列,供模型其他部分使用的网络。
- 多模态融合Multimodal Fusion把图像、语言、本体状态等不同来源的信息合到一起,让模型联合使用。
- 视觉语言模型Vision-Language Model能同时看图和读文字、再用文字作答的模型,是多数 VLA 的底座。
- 多模态大语言模型Multimodal Large Language Model以大语言模型为核心、能同时理解图像、视频、音频等输入的大模型。
- 投影层Projector / Connector把视觉编码器输出的特征映射到语言模型输入空间的小网络。
- 可学习查询Learnable Query / Action Query作为模型参数训练的一组向量,通过注意力从输入中汇总任务需要的信息。
- Q-FormerQuerying TransformerBLIP-2 中用 32 个可学习查询提炼图像信息、再交给大语言模型的小模块。
- Perceiver 重采样器Perceiver Resampler用少量可学习查询向量,把数量不定的视觉特征压成固定数目的视觉 token。
- 从大量图像 token 里自适应地汇总出少数几个关键 token 的模块,用来省算力。
- PaliGemmaPaliGemma (Google open VLM)谷歌开放权重的视觉语言模型,由 SigLIP 视觉编码器加 Gemma 语言模型组成。
- 通义千问 Qwen-VLQwen-VL series (Qwen-VL / Qwen2-VL / Qwen2.5-VL / Qwen3-VL)阿里通义千问团队的开源视觉语言模型系列,常被用作 VLA 的骨干。
- 动态分辨率(原生分辨率输入)Dynamic / Native Resolution (Vision Encoder)视觉编码器按图片原尺寸切块,图越大视觉 token 越多,不再统一缩放。
- Prismatic VLMPrismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models斯坦福与丰田研究院系统比较 VLM 设计的研究和开源模型,OpenVLA 的底座。
- Eagle(英伟达 VLM)NVIDIA Eagle VLM英伟达开源的视觉语言模型系列,GR00T N1 到 N1.6 都用它当视觉语言主干。
- 原生多模态Native Multimodal (Model)从预训练一开始就同时学多种模态,而不是给语言模型后接视觉模块。
- 统一多模态模型Unified Multimodal Model一个模型既能看懂图像视频、回答问题,又能生成或编辑图像视频。
- BAGELBAGEL: Emerging Properties in Unified Multimodal Pretraining (ByteDance Seed)字节 Seed 开源的统一多模态模型,同一个模型既能看懂图也能生成和编辑图
11.4生成模型入门
前面的模型只给一个答案;这里学整个数据分布,以及把向量变成离散码。
- 生成模型Generative Model学习数据的概率分布、能从中采样出新数据的模型。
- 自编码器Autoencoder先把输入压成短向量、再还原回来,借此学到数据要点的网络。
- 潜在空间Latent Space模型把原始数据压缩后得到的内部表示空间,相似的东西在里面挨得近。
- 变分自编码器Variational Autoencoder把数据压成服从某种分布的潜变量,并能从中采样还原或生成数据的模型。
- 条件变分自编码器Conditional Variational Autoencoder给定条件时学习输出分布的 VAE,同一输入能生成多种合理结果。
- 生成对抗网络Generative Adversarial Network (GAN)生成器造假、判别器辨真假,两者对抗训练来生成逼真数据的模型。
- 标准化流Normalizing Flow用一串可逆变换把简单分布变成复杂分布、能精确算出概率的生成模型。
- 向量量化Vector Quantization准备一本「码本」,把连续向量换成离它最近的码字编号,变成离散 token。
- 向量量化变分自编码器Vector-Quantized Variational Autoencoder编码结果被码本量化成离散编号的自编码器,常用来把图像、视频、动作变成 token。
- 有限标量量化Finite Scalar Quantization把连续向量的每一维直接取整到几个固定档位,代替 VQ 码本的离散化方法。
11.5扩散模型与流匹配
上节生成模型的主力路线:加噪去噪与流匹配,动作和视频生成都靠它。
- 扩散模型Diffusion Model先学会一步步去掉噪声,再从纯噪声出发逐步生成数据的生成模型。
- 去噪扩散概率模型Denoising Diffusion Probabilistic Model2020 年提出的扩散模型经典形式:逐步加噪,再学会逐步去噪来生成数据。
- 流匹配Flow Matching学习一个把噪声平滑搬运成真实数据的速度场,再沿它积分生成样本的方法。
- 速度场Velocity Field流匹配模型学的函数:告诉样本在每个时刻该往哪个方向、以多快速度移动。
- 整流流Rectified Flow让噪声沿直线走向数据的生成模型,路径越直,采样需要的步数越少。
- 先逐层压缩再逐层还原、同层左右直接相连的 U 形卷积网络。
- 扩散 TransformerDiffusion Transformer用 Transformer 取代 U-Net 作为扩散模型去噪网络的架构。
- FiLM 特征调制Feature-wise Linear Modulation用条件信息给每个特征通道算一组缩放和偏移,去调制网络的中间特征。
- 自适应层归一化Adaptive Layer Normalization用条件信息(如扩散时间步)动态算出层归一化的缩放和偏移
- 无分类器引导Classifier-Free Guidance同时算有条件和无条件两种预测并按比例外推,让生成结果更贴合条件
- 潜在扩散模型Latent Diffusion Model先用自编码器把数据压缩到低维隐空间,再在隐空间里做扩散生成的模型。
- 噪声调度Noise Schedule规定扩散模型每一步加多少噪声的时间表,影响训练效果和生成质量。
- 预测目标参数化(ε / v / x₀ 预测)Prediction Target Parameterization (ε-prediction / v-prediction / x₀-prediction)扩散模型的网络该输出噪声、速度还是干净数据,这个选择叫预测目标。
- 分数函数 / 分数匹配Score Function / Score Matching「分数」是对数概率密度对输入的梯度,分数匹配是用神经网络学这个梯度的方法。
- 去噪步数Denoising Steps / Number of Function Evaluations扩散或流匹配模型生成一次结果要调用几次网络,直接决定推理速度。
- 去噪扩散隐式模型Denoising Diffusion Implicit Model沿用 DDPM 的训练方式、把采样改成可跳步的确定性过程的扩散加速方法。
- 扩散 / 流采样器(ODE / SDE 求解器)Diffusion / Flow Samplers (ODE / SDE Solvers, e.g. Euler, DPM-Solver)把训练好的扩散或流模型从随机噪声一步步积分成样本的数值算法。
- 一致性模型Consistency Model能把噪声一步映射回数据的生成模型,用来把扩散的多步采样压到一两步
- 单步生成One-step Generation只跑一次网络前向就从噪声直接得到结果,用来解决扩散模型采样慢。
- 平均流MeanFlow (Mean Flows for One-step Generative Modeling)学习一段时间内的「平均速度」,一步就能从噪声生成样本的生成方法。
- 离散扩散Discrete Diffusion在文字 token 这类离散符号上做加噪和去噪的扩散模型。
- 扩散语言模型Diffusion Language Model用扩散方式对整段文本并行去噪、而不是逐字往后生成的语言模型。
11.6动作怎么表示和输出
有了网络和生成方法,看机器人动作怎样表示,又怎样回归、离散或生成出来。
- 动作头Action Head接在骨干网络后面,把提取出的特征转换成具体机器人动作的输出模块。
- 动作表示Action Representation用什么量、相对什么坐标、什么格式来描述机器人要做的动作。
- 增量动作 / 绝对动作Delta (Relative) Action vs. Absolute Action动作写成「再挪多少」(增量),还是写成「移动到哪个坐标」(绝对)。
- 连续动作回归Continuous Action Regression让网络直接输出连续的动作数值,用 L1 或均方误差去对齐示范动作。
- 动作分块Action Chunking策略一次预测接下来一小段连续动作,而不是每一步只输出一个动作。
- 动作视界Action Horizon策略每次看几步历史、预测几步动作、实际执行几步。
- 时序集成Temporal Ensembling每步都预测动作块,把多个块对同一时刻的预测加权平均后再执行。
- 关键帧动作预测Keyframe Action / Next-Best-Pose Prediction只预测任务中几个关键的末端位姿,两点之间的路径交给运动规划器。
- 分箱离散化Action Binning / Discretization把每个连续动作维度等分成若干区间,用区间编号当离散 token。
- 动作分词器Action Tokenizer把连续动作编码成离散 token、推理时再解码回动作的模块。
- 离散余弦变换Discrete Cosine Transform把一段信号拆成不同频率余弦波加权和的变换,常用于数据压缩。
- 高斯策略Gaussian Policy网络输出动作的均值和标准差,再从正态分布里采样动作的随机策略。
- 高斯混合模型Gaussian Mixture Model用几个高斯分布加权叠加来描述数据的概率模型,可以有多个峰。
- 混合密度网络Mixture Density Network神经网络不直接输出一个值,而是输出一个高斯混合分布的参数。
- 能量模型Energy-Based Model不直接输出答案,而是给「输入-输出」配对打分,分最低的就是答案。
- 扩散动作头Diffusion Action Head接在策略主干后面、用扩散去噪的方式生成连续动作的输出模块。
- 残差策略Residual Policy在已有控制器或策略的输出上再学一个修正量,两者相加作为最终动作。
11.7VLA 的结构与扩展
VLM 接上动作输出就成了 VLA:看它怎样出动作、跨机器人、接更多传感器。
- 端到端End-to-End用一个模型从原始传感器输入直接输出控制指令,中间不拆成人工设计的模块。
- 具身大模型Embodied Foundation Model在大量跨机器人、跨任务数据上预训练,能适配多种机器人和任务的大模型。
- 大行为模型Large Behavior Model丰田研究院提出的多任务机器人通用策略,在大量示范数据上预训练。
- 视觉-语言-动作模型Vision-Language-Action Model看图、听懂语言指令,直接输出机器人动作的大模型。
- 并行解码Parallel Decoding一次前向同时输出整段序列,而不是像自回归那样逐个 token 生成。
- 动作专家Action ExpertVLA 里专门负责生成连续动作的一组独立参数,与看图读指令的主干分工。
- 混合 Transformer 架构Mixture-of-Transformers不同模态各用一套 Transformer 参数,但每层通过全局自注意力互相看见。
- 自回归-扩散混合架构Hybrid Autoregressive-Diffusion Architecture同一个模型里,离散内容用自回归逐个生成、连续内容用扩散生成的架构。
- 统一动作空间Unified Action Space把不同机器人的动作按物理含义放进同一个固定格式,便于混合训练。
- 本体专属头Embodiment-specific Head跨本体模型里为每种机器人单独配的输出层,把共享特征转成该机器人的动作。
- 状态编码器State / Proprioception Encoder把机器人关节角、夹爪开合等自身状态变成模型可用向量的小网络。
- 历史编码器History Encoder把最近一段观测和动作压成一个向量,让策略推断当下的环境状况。
- 点云编码器Point Cloud Encoder把一堆无序的三维点转换成神经网络能用的特征向量的模块。
- 3D VLA3D / Spatial Vision-Language-Action Model把深度、点云、3D 位置等空间信息显式放进模型的 VLA
- 力觉 VLAForce-aware Vision-Language-Action Model在视觉和语言之外,把力/力矩信号也当作输入的 VLA 模型。
- 视觉-触觉-语言-动作模型Vision-Tactile-Language-Action Model在 VLA 基础上加入触觉输入的机器人模型,专攻需要「手感」的接触类任务。
- 记忆增强 VLAMemory-Augmented VLA (Memory-Augmented Vision-Language-Action Model)给 VLA 加上历史记忆模块,让它依据过去发生的事而不只是当前画面来决策。
11.8分层系统与具身推理
和上节端到端相对:规划与控制分给不同模型,再让模型先推理后行动。
- 分层架构Hierarchical Architecture把机器人决策拆成高层规划和底层执行两级,分别由不同模型负责。
- 具身推理模型Embodied Reasoning Model专门做物理世界理解和任务规划的多模态大模型,常被称为机器人的「大脑」。
- 快慢双系统Dual-System Architecture (System 1 / System 2)慢而会思考的大模型负责理解和规划,快而轻的小模型负责实时动作控制。
- System 0(三层系统架构)System 0 (S0/S1/S2 Three-Layer Architecture)在快慢双系统之下再加一层千赫兹级全身控制网络,专管平衡、接触和全身协调。
- 行为基础模型Behavior Foundation Model经大规模预训练的人形全身控制模型,能零样本或快速适配多种运动任务
- 人体动作生成模型(文本生成动作)Human Motion Generation / Text-to-Motion (e.g. MDM)根据文字描述等条件,生成一段三维人体骨骼动作序列的模型。
- 中间表示Intermediate Representation模型在指令和底层动作之间先预测出的过渡信息,如二维轨迹、关键点。
- 视觉提示(Set-of-Mark 标记提示)Visual Prompting (Set-of-Mark / Mark-based Visual Prompting)在图片上画编号、框、点等标记,让视觉语言模型用「选标号」的方式指出位置。
- 具身思维链Embodied Chain-of-Thought让机器人模型先写出计划、子任务、物体位置等推理,再输出动作。
- 视觉思维链Visual Chain-of-Thought让模型先产出图像、框选区域等视觉中间结果,再据此给出答案或动作。
- 动作思维链Action Chain-of-Thought让 VLA 先在动作空间里推出一条粗轨迹,再据此生成精细动作
- 潜在推理Latent Reasoning让模型在内部隐藏状态里完成多步推理,而不是逐字写出思维链。
11.9世界模型与视频生成
用前面的生成模型预测「做了动作世界会怎样」,最后与动作生成合二为一。
- 世界模型World Model能预测「做了某个动作之后,世界会变成什么样」的模型。
- 正向动力学模型Forward Dynamics Model输入当前状态和动作,预测下一时刻状态会变成什么样的模型。
- 逆动力学模型Inverse Dynamics Model看前后两帧画面,推断中间做了什么动作的模型。
- 潜在动作Latent Action从前后画面变化里自动学出的抽象动作编码,不需要真实动作标签。
- 潜在动作模型Latent Action Model从无标签视频学出潜在动作的模型,靠编码器加解码器重建下一帧来训练。
- ViLLA 架构Vision-Language-Latent-Action智元 GO-1 用的分层架构:先预测潜在动作 token,再解码成真实动作。
- 视频预测模型Video Prediction Model根据已有画面(常加上计划执行的动作)预测接下来画面的模型。
- 视频生成模型Video Generation Model根据文字、图片或已有片段,生成一段连贯新视频的生成式模型。
- 文生视频 / 图生视频Text-to-Video / Image-to-Video按一段文字,或一张图片加文字,生成一段视频的任务。
- 视频分词器Video Tokenizer / Video VAE把视频压成少量 token 或潜在向量、又能还原回画面的编解码网络。
- 时空块Spacetime Patches把视频在时间和空间上一起切成的小立方块,每块当作一个 token 交给 Transformer。
- 通义万相Wan (Alibaba open video generation model)阿里通义团队的视频生成模型,Wan2.1/2.2 开放权重,常用作世界模型底座。
- 世界基础模型World Foundation Model在海量真实视频上预训练、可再微调成各种专用世界模型的通用世界模型。
- 自回归视频生成Autoregressive Video Generation按时间顺序一帧或一段接一段往后生成视频,可以边生成边播放
- 曝光偏差(自回归误差累积)Exposure Bias训练时看真值、推理时看自己的输出,导致误差一步步累积的问题。
- 扩散强制Diffusion Forcing给序列里每个 token 加各自独立强度的噪声来训练的因果扩散序列模型。
- 可交互世界模型Interactive World Model每一步接收动作输入、据此生成接下来画面的世界模型,可当神经网络模拟器用。
- 隐空间世界模型Latent World Model在压缩后的隐状态里预测「执行某个动作后世界会怎样变化」的世界模型。
- 循环状态空间模型Recurrent State-Space ModelDreamer 系列世界模型的核心结构,用确定性循环状态加随机隐变量预测未来。
- 联合嵌入预测架构Joint-Embedding Predictive Architecture在抽象表征空间里预测被遮住或未来的内容,而不还原像素的自监督架构。
- 表征坍缩Representation Collapse自监督训练时编码器对所有输入都输出相同或相近的向量,表征失去信息。
- 4D 世界模型4D World Model预测三维场景随时间如何变化的世界模型(3D 空间加时间)
- 世界动作模型World Action Model同时预测未来画面和机器人动作,用对世界的预测来指导动作的模型。
11.10推理加速、部署与可靠性
前面所有模型最终都要上机:怎样更快更省,以及怎样知道它没把握。
- 推理延迟Inference Latency模型从拿到输入到算出输出所花的时间,决定机器人反应快慢。
- 异步推理Asynchronous Inference机器人边执行当前动作块,模型边算下一块,不停下来等。
- 实时动作分块Real-Time Chunking边执行当前动作块边算下一块,并让新块与已执行动作平滑衔接的方法。
- 浮点运算量(FLOPs)Floating-Point Operations (FLOPs)完成一次计算要做多少次浮点加法和乘法,衡量模型算得有多重。
- KV 缓存Key-Value Cache把已算过的注意力键和值存起来,生成后续 token 时直接复用。
- 投机解码Speculative Decoding先让小模型快速猜几个 token,再让大模型一次并行核对,结果不变、速度更快。
- 训练后量化Post-Training Quantization模型训练完后,直接把权重和激活换成低比特数值,不用重新训练。
- 量化感知训练Quantization-Aware Training训练时就模拟低比特带来的误差,让模型提前适应,量化后精度掉得更少。
- 剪枝Pruning删掉模型里不重要的权重、通道或层,让模型变小变快。
- 视觉 token 剪枝Visual Token Pruning推理时丢掉或合并不重要的图像 token,让视觉语言模型和 VLA 跑得更快。
- 早退机制Early Exit让简单输入在网络中间层就提前输出结果、省掉后面几层计算的方法。
- 端侧模型On-device Model直接跑在机器人、手机等设备本地芯片上、不依赖云端的模型。
- 不确定性估计Uncertainty Estimation / Quantification让模型在给出预测的同时说明自己有多没把握,好知道何时该停下或求助。
- 高斯过程Gaussian Process直接在「函数」上建概率分布的方法,预测时同时给出不确定度。
- 可解释性(机制可解释性)Interpretability (Mechanistic Interpretability)研究神经网络内部怎样得出输出;机制可解释性要把计算拆成人能懂的特征和回路。