开云(中国)Kaiyun·官方网站

开云(中国)Kaiyun·官方网站以线性能干力承担主要全局高下文团聚使命-开云(中国)Kaiyun·官方网站

发布日期:2026-07-27 10:54    点击次数:123

开云(中国)Kaiyun·官方网站以线性能干力承担主要全局高下文团聚使命-开云(中国)Kaiyun·官方网站

盖世汽车获悉 近日,小鹏汽车精致发布TuringViT高效视觉编码器。该系统针对VLM/VLA期间视觉编码器的架构缱绻、数据范式与进修经过进行了系统性重构,将相沿智能驾驶、智能座舱及IRON东说念主形机器东说念主三伟业务场景。

图片开首:小鹏汽车

面前行业多数遴选的复用开源通用ViT决策,在高差异率、多视角、流通视频帧等委果场景底下临算力本钱、数据成果与场景适配三重瓶颈。TuringViT从架构、数据、进修三个维度同步鼓吹,提议了相应的时期旅途。

架构方面,TuringViT遴选Turing线性能干力算作中枢筹谋单位,构建了羼杂Turing Block架构,以线性能干力承担主要全局高下文团聚使命,筹谋复杂度从二次方降至近线性。实测清晰,1536×1536差异率下,TuringViT-18L推理费解量达到Seed1.5-ViT的3.04倍。该系统提供18L和24L两个规格版块。

数据方面,TuringViT打造了VISTA-Curation多模态数据处理活水线,通过图文和视频数据的多阶段筛选与标注优化,栽培单样本监督价值。该系统仅使用0.85B图文对完成进修,约为SigLIP2-L进修数据规模的10%,在ImageNet-1K等六项零样分内类基准上赢得83.6%的平均准确率。

进修方面,TuringViT遴选四阶段渐进式原灵活态差异率进修范式,从预进修阶段即适配卑劣VLM/VLA的输入特色,谐和二维旋转位置编码,支握不同尺寸与长宽比的输入。

运用层面,TuringViT将算作小鹏第二代VLA模子的中枢视觉编码器开云(中国)Kaiyun·官方网站,负责处理多路环顾录像头输入;在智能座舱场景中相沿视觉与话语模子的对皆;同期为IRON东说念主形机器东说念主提供物体识别、空间关连深切等基础感知本事。小鹏暗意,该系统的架构缱绻与进修经过不依赖特定硬件平台,可为行业提供可复现的视觉大模子进修旅途。