96SEO 2026-02-19 10:43 15
详见《火爆全球的DeepSeek系列模型》涉及对GRPO、MLA、V3、R1的详尽细致深入的解读

还不如具身智能deepseek之外具身智能也一直在稳定加速但如果不小心
则会漏掉很多重要信息——比如π0「详见《π0——用于通用机器人控制的VLA模型一套框架控制7种机械臂(基于PaliGemma和流匹配的3B模型)》」到底还是开源了开源于25年2.4日..
如此我也算是被打脸了因为我曾在发表于25年1.11日的这篇《一文通透OpenVLA及其源码剖析》文章里说
没开源必然是有点遗憾故这两天我一直在考虑、对比看目前哪个vla最逼近π0然后借鉴π0的思路去改造该vla”
且顺藤摸瓜才发现原来π0背后公司还发布了一个FAST版的模型π0_FAST且也把其一块开源了
本次π0及π0-FAST的GitHub地址github.com/Physical-Intelligence/openpi
本文便来解读下这个π0_FAST之后再解读下他们的源码——相当于π0系列
也会至少写三篇文章上一个有3篇或以上文章的具身系列则是iDP3这两个架构
进一步讲以上的「大模型和具身」这两大热点是否可以结合呢当然可以的比如deepseek也是可以赋能具身智能的——其与具身结合潜力比较大的一点是其推理速度比标准transformer更快
才能真正推动社会大模型与具身的结合便是一大应用方向而对于本文的主角π0及π0-FAST他俩的开源意味着我们今年q1在具身方面的一些落地工作对于被微调模型的选择上便多了一个——如此好事一件啊
一般论文的摘要、引言、相关工作都是一个个独立的部分是可以单独拎出来理解的所以这几个部分之间
会不可避免的有所重叠或重复而本文是作为一个整体呈现在大家面前的所以会去掉这类重复尽可能简洁、紧凑、清晰
最近多项研究开发了通用机器人策略[9-RT-1,51-Octo,6-Roboagent,10-Rt-2,20-
navigation,39-Openvla,62-Scaling
one-shot47-Roboturk35-Dexmimicgen
训练通用策略的一种有前途的方法是视觉-语言-动作模型VLAs包括且不限于
reasoning7-π063-Tinyvla73-Tracevla:
这些模型是在互联网上规模庞大的图像和文本数据上预训练的用于机器人控制
都已在本博客中详尽深入细致的解读过详见视觉语言动作机器人从Robotics
使用具有数十亿参数的大型视觉-语言模型骨干为拟合大型机器人数据集提供了必要的表达能力重用在互联网规模数据集上预训练的权重还提高了VLAs遵循多样化语言命令和泛化的能力例如适应新对象和场景背景[10,39,67,63,36-
总之大型、高容量的Transformer模型在从头开始捕获复杂且可泛化的机器人行为方面可以非常有效[8-Rt-1,69-ALOHA
ACT,51-Octo,6-Roboagent,20-Scaling
可以使用在互联网规模的图文语料库上预训练用于下一个token预测的模型[10-Rt-2,39-Openvla——这两都是使用下一个token预测技术独立预测动作token,63-Tinyvla-将一个基于扩散的头部附加到预训练的多模态模型上以直接输出机器人动作,7-π0,65-Latent
然而这些模型需要选择连续动作信号的分词方式这决定了模型预测的离散符号需要考虑如何映射到连续的机器人动作[64-Elastictok:Adaptive
关于分词——分词方法的选择对模型训练和下游性能有显著影响[55]。
虽然有多项研究探索“无分词”语言模型的训练[28,53-Byte
tokens]这些模型直接在bit流上操作但目前大多数语言模型在训练前依赖文本分词阶段
对于VLA训练的动作表示先前的研究探索了用于训练机器人策略的各种动作参数化包括VLA
一种研究方向使用“语义”动作表示例如语言子任务[21-Palme,2-2-Do
这种方法通常可以从少量示例中学习甚至可以在没有任何机器人示例的情况下零样本执行任务[50,32,25]但需要手工设计的低级控制器来执行任务限制了其通用性另一种方法是直接训练VLA以在给定图像和语言指令输入时输出低级机器人控制命令
最常见的设计是将动作直接嵌入到离散的token中可以通过标准自回归序列模型生成就像任何流行的视觉语言模型一样
而好的分词选择对序列模型的性能至关重要[55-GPT2,57-Neural
此类先前的机器人策略通常使用基于每维度、每时间步的分箱方案的简单分词策略[9,10-Rt-2,39-Openvla]——将连续的机器人动作映射到离散的动作token
但作者发现当学习具有高频控制的灵巧技能时这种方法表现不佳「即这种方案在扩展到高频机器人控制任务时遇到了困难」见下图图2右
且作者注意到在预测未来动作序列即动作“组块”时时间步之间的相关性对于简单的token化策略来说是一个重大挑战这在高频控制中很常见
因为高度相关的动作token会削弱自回归视觉语言模型中使用的下一个token预测目标的效果
直观地说在这种情况下低token预测损失通常可以通过简单地复制最近的动作token来实现这使得模型处于较差的局部最优状态
token化方案允许在高频数据上训练自回归VLA此外虽然还有许多研究也提出了token化的替代方案例如通过使用回归头或引入新的权重进行扩散解码[20-Scaling
但作者的方法不需要修改底层的预训练变压器模型可以轻松应用于任何预训练的自回归变压器模型并在许多任务上实现了与最先进的基于扩散的VLA[7-即π0]相媲美的性能同时训练时计算效率显著提高另一组相关研究探索了向量量化动作表示[41-Behavior
这些方法训练了一个向量量化的编码器-解码器网络其重建质量对超参数选择和结构敏感[66-Magvit:
可结果发现这些方法在粗略、低保真重建任务中表现良好但在需要细粒度控制的高频任务中失败
token化方案具有很少的超参数并且能够在提供强大压缩特性的同时高精度地重建动作
他们的关键见解是机器人动作信号在训练前需要被压缩以减少连续token之间的相关性
从基于压缩的分词策略中汲取灵感比如语言模型常用的字节对编码方法[27,57]——通过合并频繁出现的token序列为新token来压缩输入文本然而由于机器人动作是连续的相应的压缩策略应相应选择。
因此他们的方法基于离散余弦变换DCT编码这种方法广泛用于压缩连续信号如图像例如
且发现如此所得的分词方法频率空间动作序列分词FAST使他们能够通过简单的下一个token预测见上图图
策略用于高灵巧度和高频率任务——而对应的标准离散化方法完全失败此外FAST
所得策略是第一个可以在未见环境中成功进行零样本评估的语言条件通用操控策略只需用自然语言提示即可且基于FAST作者还开发了FAST一种通用的机器人动作分词器训练于100
他们证明了FAST分词器能够有效地对各种机器人动作序列进行分词从单臂到双臂和移动机器人并且是训练自回归VLA
这使得产生时间一致的动作更容易并减少复合错误动作tokenization的目标是定义一个映射从连续动作序列维度为|A|到大小为|V|
可能在动作序列之间不同就像长度相同的句子可能被tokenized为可变数量的文本token一样
动作tokenization中最常用的方法是简单的分箱离散化方案[8,10-Rt-2,39-Openvla,72-3dvla,56-A
对于给定的动作a该方法独立地对每个维度进行离散化将训练数据集中的值范围划分为N
维动作序列a1:H这种标记方案将应用于每个时间步最终得到的token序列为
对于高频率的机器人数据这种tokenization方案是次优的它很容易为每个动作块产生数百个token从而使训练变得具有挑战性并导致推理速度缓慢
为了更好的说明对于RT-2和OpenVLA使用那种动作tokenization方法训练自回归策略的所面临挑战作者举了一个案例「这个案例问题反映了在高频动作块上训练的策略所面临的挑战这些策略必须在给定某些条件信息的情况下预测一系列连续动作」
首先创建一个合成时间序列数据集其目标是预测一个立方样条该样条插值四个随机生成的点见图3底部
[39]使用的每维度分箱方案进行比较——那种方案被称native
如果使用以前VLA策略中采用的简单tokenization方案对目标序列进行tokenize该方案将序列中的每个元素分别离散化为256个区间中的一个
然后训练一个小型自回归transformer策略在给定条件点的情况下预测tokenized信号
他们针对目标信号的不同采样率重复此实验从每个序列的25到800个时间步长不等而不更改基础数据集这模拟了在不同频率收集的动作数据上训练自回归策略
在不同频率下训练的自回归模型的平均预测均方误差MSE如下图图3顶部所示“简单”——可以看出来在DCT压缩目标token上训练自回归模型在各种采样频率下始终保持较低的预测误差
他们观察到使用分箱tokenization的模型在低采样率下实现了良好的预测性能即低MSE
但随着采样率的增加预测误差急剧增加直到最终模型仅复制第一个动作如下图图3左下角的定性可视化所示
请注意这个问题不能归因于数据本身底层数据分布的复杂性没有改变作者预计具有相同容量并在相同步数下训练的模型将在所有采样率下实现可比的性能
要理解分词方案如何影响学习性能需要查看学习目标本身。
从根本上说自回归模型被训练为在给定所有先前token的情况下预测下一个token
关键是当使用简单的每时间步分词方案时随着训练信号的控制频率增加这种边际信息趋近于零
对于平滑信号随着时间步变短每个时间步的变化按比例减少。
这极大地减慢了训练期间的收敛速度并可能使拟合复杂的高频数据集具有挑战性实际上此类挑战在之前的工作中已有观察。
例如OpenVLA
因此这个案例的研究结果强调了为机器人动作设计更好分词方案的重要性
经过上文可知高频动作轨迹中的冗余可能导致每个动作token的边际信息量低从而导致训练性能不佳
为了解决这个问题需要一种tokenization方法将高度冗余的动作信号压缩成较少数量的高信息量token
在本节中按照原论文的描述将首先介绍一种压缩连续时间序列的简单方法然后使用它来设计一个动作tokenization算法最后解释我们如何训练一个通用的机器人动作tokenizer
关于有效压缩连续时间序列的研究已有丰富的工作从将信号转换到频域后进行压缩的方法[18,1,61]
他们工作的一个关键结论是任何足够有效的压缩方法在应用于动作目标时都适合于提高VLA模型的训练速度。
在实践中仍有一些因素可能导致作者偏向于某些压缩算法而非其他算法例如训练分词器的复杂性以及其在动作的分词和去分词上的效率如何
在π0-FAST中作者使用了一种基于离散余弦变换DCT的压缩算法[1-Discrete
transform]。
DCT是一种频域变换它将连续信号表示为各种频率的余弦元素之和
低频捕捉信号的整体形状而高频分量反映出急剧的跳变。
由于其简单性和计算效率以及对实际图像的强压缩特性DCT是一种常用的压缩算法转换例如用于JPEG图像压缩[61-The
compressionstandard]且因为像素通常变化平滑DCT通常可以用少数系数表示输入信号的大部分信息。
信号可以通过省略低权重的频率分量来压缩
总之与基于矢量量化的学习压缩方法相比基于DCT的压缩是一种解析方法因此极其简单和快速
FAST分词算法结合离散余弦变换DCT和字节对编码BPE压缩动作块
如此作者使用离散余弦变换来设计FAST这是一种快速有效的机器人动作tokenization方法。
我们在下图图4
中详细介绍了从原始机器人动作到动作tokens的步骤「给定一个标准化的动作块应用离散余弦变换DCT将信号转换到频域。
然后对DCT系数进行量化并使用字节对编码BPE将每个维度的DCT系数扁平化序列压缩成最终的动作token序列」
这个初始标准化步骤有助于将数据带入指定范围并且还使得具有不同动作尺度的跨实体数据集的标记化更为容易
且使用分位数来应对大型机器人数据集中偶尔出现的异常动作在数据标准化后作者对每个动作维度分别应用离散余弦变换DCT
转换后的信号可以简单地省略不重要的系数这通过一个缩放和舍入操作来实现其中缩放系数是一个超参数用于在tokenization操作的损失性和压缩率之间进行权衡在舍入操作之后DCT系数矩阵通常是稀疏的大多数条目为零每个动作维度仅保留少数几个重要系数为了真正实现压缩必须将这个稀疏矩阵转换为一系列密集的token
故将矩阵展平为一个一维的整数向量通过首先包括所有低频分量来交错动作维度并训练一个字节对编码BPE分词器
矩阵因为有许多高效的实现并且它可以生成一个固定大小的输出词汇表可以轻松集成到现有的视觉-语言模型词汇表中以进行VLA
另作者在算法1中简要总结了他们的tokenization方法并在原论文的第VI节测试了FAST
此外请注意在BPE编码之前对DCT系数矩阵进行展平的顺序可能对策略训练产生重大影响——即上述步骤的第4步
列优先展平即首先连接每个维度的最低频率分量或者行优先展平即首先连接单个动作维度的所有频率分量
作者选择前者因为他们发现在自回归预测期间首先预测表征输出序列整体形状的低频分量会导致更稳定的策略展开——We
如此tokenization流程中的所有操作都易于逆转允许快速解码预测的动作
tokenizer只有两个超参数在舍入之前应用于DCT系数的比例和BPE压缩步骤的词汇量大小。
作者发现这两个参数都不太敏感并且在所有的单数据集tokenization实验中使用相同的值舍入比例10BPE词汇量大小1024。
这与依赖于矢量量化的端到端学习压缩模块形成对比
这些网络通常训练起来很繁琐并且需要仔细选择特定于数据集的超参数才能实现良好的重建效果。
作者的实验表明作者基于DCT的标记化方法比基于VQ的方法训练出性能更高的策略同时显著更简单且更容易调整
案例研究token化如何影响VLA训练」的研究示例中基于DCT的tokenization的好处
下图图3显示在DCT压缩目标token上训练自回归模型在各种采样频率下始终保持较低的预测误差
分词的额外负担。
因此作者希望再训练一个通用动作分词器它可以对来自任何机器人的动作片段进行编码
为此作者使用上述流程在一个大型跨形态机器人动作数据集上训练分词器该数据集由大约一百万个1秒的动作片段组成涵盖单臂、双手和移动操作机器人具有关节和末端执行器控制动作空间以及各种控制频率——他们在附录A中详细列出了用于训练通用分词器的数据混合物
对于许多数据集他们包括了多个动作空间参数化版本联合空间、末端执行器世界框架和末端执行器摄像头框架以确保生成的分词器的通用性。
Open
一旦训练完成通用动作分词器FAST可以作为一个黑箱分词器应用于任何机器人设置的1秒动作序列。
且实验评估显示它与为单个数据集调优的分词器具有竞争力
且发布了该预训练通用动作分词器的代码在一个方便的HuggingFaceAutoProcessor类中使得在三行代码中轻松将分词器应用于任何新的机器人动作块
AutoProcessor.from_pretrained(physical-intelligence/fast,trust_remote_codeTrue
为了获得最佳压缩效果作者建议将输入动作通过分位数归一化方法标准化到范围[-1,
FAST分词算法》所述并一次性对1秒的动作块进行tokenizing
AutoProcessor.from_pretrained(physical-intelligence/fast,trust_remote_codeTrue
与替代动作tokenization方案进行比较并分析关键设计决策
作者基于流行的VLA骨干网络对于自回归VLA训练测试不同的分词方案
在作者的大多数实验中作者使用π0[7]如本文开头所述这是一种基于PaliGemma-3B
[5]的VLA且还测试了OpenVLA[39]它基于Prismatic
[10-Rt-2,39-Openvla]的做法用结果动作token覆盖VLM词汇表中使用最少的token——这句话
具体而言作者使用π0[7]和OpenVLA[39]骨干网络训练策略。
根据任务的不同策略依赖于两个或三个输入图像一个第三人称摄像机和每个机器人手臂一个腕部摄像机使用224x224像素的分辨率VLA骨干网络通过预训练的视觉编码器分别编码每个图像并将生成的tokens连接起来。
且还基于自然语言任务指令和机器人的本体感受状态进行条件设置两者都通过LLMs语言分词器进行分词将它们视为字符串
对于本体感受状态我们应用了一种类似于RT-2动作分词[10]的bin分词预处理将其离散化为256个bins然后将整数作为文本输入序列的一部分进行分词
请注意对于本体感受状态一个简单的bin分词方案就足够了因为它是一个输入到策略相对于需要高级tokenization的操作输出使用短线性学习率预热1k
0.95)不进行权重衰减将梯度幅度裁剪到1并计算网络权重的EMA权重为0.999
有助于使策略从初始位置移动因为一些数据包含了机器人在训练开始时悬停在初始位置的静止动作段
作者开发了一套7个评估任务6个真实机器人1个模拟见下图图5旨在测试VLA在高度灵巧的任务如折叠洗衣物和泛化任务如在未见过的环境中0-shot执行桌面操作上的性能
[43]模拟基准套件上进行测试。
测量Libero-Spatial、Libero-Object、Libero-Goal和Libero-10的平均性能桌面清理[7]
Hz)一个UR5单臂机器人需要清理桌面将12个物体分类到垃圾桶中和一个塑料容器用于放置盘子、碗、杯子和餐具。
该任务需要精确抓取各种物体更多任务见原论文..
的动作tokenization方法分别在每个评估数据集上进行训练以及FAST通用的基于
请注意在能够组装的最具多样性的真实机器人数据集上训练了通用tokenization器其中包括来自作者真实机器人评估任务的数据
[39]使用的每维度分箱方案进行比较——那种方案被称native
当然了虽然作者的方法提供了无需训练任何单独模型的压缩tokenization但也可以考虑一种替代的压缩方案
的一种更简单的替代方案这种tokenization策略以前用于标记高维图像数据[48,66]可以视为作者基于压缩的方法的消融该方法利用压缩表示但采用一种更复杂的基于学习的替代方案而不是相对简单的基于DCT的方法
首先在下表表I中提供了作者提出的FAST分词器与先前工作中使用的简单分箱方案之间的压缩率比较他们使用来自具有不同动作维度和控制频率的数据集的1秒动作块
对于以上的这两种方法使用默认的超参数这些参数具有可比的分词错误。
可以看到
FAST在所有数据集上都实现了输入动作序列的显著压缩。
对于高频动作数据的数据集压缩优势尤为明显有趣的是FAST在每个领域中始终为每个机器人臂块生成大约30个动作token即双手设置中为60个token
这表明FAST找到了一个表示该表示近似于底层动作信号的复杂性并且在很大程度上与动作数据的频率无关
且注意到这种压缩并不是完全无损的在压缩比和重建精度之间存在权衡这由算法1中的尺度参数决定
表I中的数据在可比的重建精度下列出——具体请参见附录B中的图表展示我们比较的每个分词器在压缩和保真度之间的权衡
接下来使用上文2.1节(对应于原论文VI-A节)中描述的策略架构和分词方法训练策略——在图6中报告结果
总体而言可以发现之前工作中应用的简单分词在学习高频机器人数据的有效策略方面表现不佳——这在作者评估的最高频任务中特别明显Table
在这两个任务中使用简单分词训练的策略无法在任务上取得进展。
相比之下作者发现基于压缩的分词可以导致有效的训练
tokenization首次成功在DROID数据集[38]上训练出强大的通用策略该策略可以在未见过的环境中进行零样本评估而无需微调只需用自然语言提示即可而所有先前的工作包括原始的DROID论文[38]和OpenVLA[39]都没有展示零样本结果而是完全专注于共同训练或微调评估
作者通过在各种桌面操作任务上测试我们的DROID策略展示了其通用性
为了测试tokenizer的通用性作者组装了一组多样化的小型测试数据集。
该数据集涵盖了广泛的机器人形态、动作空间和控制频率见图
请注意这些数据集中没有任何一个是tokenizer训练集的一部分。
因此它们测试了一个场景将分词器应用于全新的机器人设置
分词器在各种机器人数据集上都取得了良好的压缩性能将所有数据集的动作token数量减少了2倍在某些数据集上的减少幅度更大且还测试了通用分词器在策略训练中的性能并在图6中报告了与每个数据集分词器的结果
在所有任务中通用分词器的表现与数据集特定的FAST分词器非常接近这表明通用分词器可以作为机器人动作分词的强大默认选择
FAST分词方法是否独立于基础的VLA骨架BPE压缩步骤有多重要这是FAST分词流程中唯一的学习组件
为了回答第一个问题作者在具有挑战性的高频T恤折叠数据集上训练了一个OpenVLA策略[39]比较了最初在OpenVLA中使用的native
为了符合任务设置作者修改了OpenVLA模型代码以接受多个输入图像并预测1秒的动作片段
下图的结果表明FAST能够显著提升OpenVLA的性能使其能够有效地在高频机器人操作数据上进行训练。
这表明作者的tokenization独立于底层模型骨干并且可以轻松应用于各种预训练的自回归transformer模型
其次作者在桌面整理和T恤折叠任务中对BPE编码步骤进行了消融实验下面的图表显示没有BPE编码的策略在展开性能上表现更差但仍优于native
直观地DCT变换仍然将信号的大部分信息集中在少数几个token中从而改善学习信号
然而在没有BPE中存在大量重复的0-token这会稀释学习信号并显著减慢推理速度因为模型需要自回归地预测数百个动作token最终导致策略性能变差
FAST标准版与扩散π0的比较自回归π0训练快而扩散π0推理快
的模型进行比较并使用自回归解码。
作者比较了两种模型在第VI-B节任务上的表现作者在图9
模型经常忽略语言指令导致得分较低。
作者将把对扩散和自回归VLA
的推理时间因为它必须执行更多的自回归解码步骤通常需要解码30-60
虽然没有发现这种较慢的推理会对评估的静态操作任务的性能造成影响但它确实使评估显著变慢
虽然有许多技术可以加速离散、自回归变压器模型的推理这些技术在LLM
文献中被广泛使用例如推测性解码、量化、自定义推理内核等但作者表示只能把对此的研究留待未来工作
还是比较快的——当然mamba也比标准transformer的推理速度
上文已经展示了FAST在单个机器人数据集上训练自回归VLAs的有效性但它是否能扩展到训练灵巧的通用策略
为了测试这一点我们在上一节中使用的π0-FAST模型上训练了跨多种身体结构的机器人数据混合数据集这是迄今为止最大的灵巧机器人操作数据集
它包括来自我们自己数据集的903M时间步。
此外训练混合数据集中有9.1%由开源数据集BRIDGE
模型相当包括在最具挑战性的折叠衣物任务上同时训练所需的计算量显著减少
中展示了训练过程中多个检查点的机器人评估结果在两个代表性任务清理桌子和折叠T
检查点的完整比较发现相同的结论成立由于更快的收敛π0-FAST
tokenizer使得能够在复杂、灵巧的机器人任务上训练自回归VLA而之前的tokenization方案在这些任务上完全失败
结合时可以扩展到训练通用的、跨身体的策略其性能可与最佳扩散VLA
(π)宣布正式开源π0及π0-FAST如之前所介绍的他们对用超过
该GitHub代码仓库包括4个方面简言之就是π0本身的代码和权重、特定平台上特定任务的微调checkpoint、推理代码、微调代码
s3://openpi-assets/checkpoints/pi0_base
s3://openpi-assets/checkpoints/pi0_fast_base专门为ALOHA和DROID平台上一些简单任务做的微调的checkpoint相当于在ALOHA
platforms用于根据用户自身任务和平台微调π0的代码——这个微调π0的代码
在训练数据中从未见过的环境中运行这些环境遍布世界各地包括蒙特利尔大学、华盛顿大学、韩国科学技术研究院等ALOHA
s3://openpi-assets/checkpoints/pi0_droid
个机器人平台上进行训练。
它是为微调而设计的但它可以在零样本中用于预训练数据中存在的任务例如“从烤面包机中取出面包”任务π0-FAST
s3://openpi-assets/checkpoints/pi0_fast_droid
tokenizer通过自回归离散化实现控制。
它提供了更好的语言跟踪性能但推理成本更高根据他们的经验大约高出
如果您更喜欢使用discretization而不是流匹配这是一个不错的选择
且他们还提供了一些经过微调的演示检查点。
这些检查点并非用于后续微调但可以提供开箱即用的演示。
这些检查点可能适用于您的特定机器人也可能不适用。
由于这些检查点是在使用更广泛使用的机器人例如
设置收集的相对较小的数据集上进行微调的因此它们可能无法推广到您的特定设置尽管我们发现其中一些检查点尤其是
机械臂在不同环境中执行的不同任务组成。
这些是第一批能够在全新环境中使用
这些检查点可能对整体机器人设置非常敏感但能够在完全未出现在训练数据中的全新
GPU但您也可以通过fsdp_devices在训练配置中进行配置来使用具有模型并行性的多个
gitgithub.com:Physical-Intelligence/openpi.git#
config.get_config(pi0_fast_droid)
download.maybe_download(s3://openpi-assets/checkpoints/pi0_fast_droid)#
policy_config.create_trained_policy(config,
{observation/exterior_image_1_left:
...,observation/wrist_image_left:
还提供了在DROID和ALOHA机器人上运行预先训练的检查点的推理的详细分步示例
远程推理他们提供了示例和代码用于远程运行模型推理模型可以在不同的服务器上运行并通过
无需机器人即可测试推理提供无需机器人即可测试推理的脚本。
此脚本将生成随机观察并使用模型运行推理。
有关更多详细信息请参阅此处
作者提供了一个脚本convert_aloha_data_to_lerobot.py用于将
比如从此处examples/libero/convert_libero_data_to_lerobot.py下载原始
examples/libero/convert_libero_data_to_lerobot.py
physical-intelligence/aloha_pen_uncap_diverse定义使用自定义数据集的训练配置并运行训练
配置作为示例。
您应该参考根README以了解如何使用新配置运行训练
LeRobotLiberoDataConfig定义了如何处理来自
TrainConfig定义微调超参数、数据配置和权重加载器启动策略服务器并运行推理
评估脚本中查询它来运行推理。
启动模型服务器很容易他们在此示例中使用迭代
--policy.dircheckpoints/pi0_fast_libero/my_experiment/20000
更多请参阅原GitHubgithub.com/Physical-Intelligence/openpi或者后续我对
作为专业的SEO优化服务提供商,我们致力于通过科学、系统的搜索引擎优化策略,帮助企业在百度、Google等搜索引擎中获得更高的排名和流量。我们的服务涵盖网站结构优化、内容优化、技术SEO和链接建设等多个维度。
| 服务项目 | 基础套餐 | 标准套餐 | 高级定制 |
|---|---|---|---|
| 关键词优化数量 | 10-20个核心词 | 30-50个核心词+长尾词 | 80-150个全方位覆盖 |
| 内容优化 | 基础页面优化 | 全站内容优化+每月5篇原创 | 个性化内容策略+每月15篇原创 |
| 技术SEO | 基本技术检查 | 全面技术优化+移动适配 | 深度技术重构+性能优化 |
| 外链建设 | 每月5-10条 | 每月20-30条高质量外链 | 每月50+条多渠道外链 |
| 数据报告 | 月度基础报告 | 双周详细报告+分析 | 每周深度报告+策略调整 |
| 效果保障 | 3-6个月见效 | 2-4个月见效 | 1-3个月快速见效 |
我们的SEO优化服务遵循科学严谨的流程,确保每一步都基于数据分析和行业最佳实践:
全面检测网站技术问题、内容质量、竞争对手情况,制定个性化优化方案。
基于用户搜索意图和商业目标,制定全面的关键词矩阵和布局策略。
解决网站技术问题,优化网站结构,提升页面速度和移动端体验。
创作高质量原创内容,优化现有页面,建立内容更新机制。
获取高质量外部链接,建立品牌在线影响力,提升网站权威度。
持续监控排名、流量和转化数据,根据效果调整优化策略。
基于我们服务的客户数据统计,平均优化效果如下:
我们坚信,真正的SEO优化不仅仅是追求排名,而是通过提供优质内容、优化用户体验、建立网站权威,最终实现可持续的业务增长。我们的目标是与客户建立长期合作关系,共同成长。
Demand feedback