小鹏正式发布TuringViT高效视觉编码器。据悉,该模型面向VLM/VLA时代系统性重构了视觉编码器的架构设计、数据范式与训练流程,将全面支撑智能驾驶、智能座舱与人形机器人三大业务场景。
视觉编码器是物理AI的“感知入口”。行业普遍采用的“复用开源通用ViT”方案,已难以匹配智能驾驶等真实场景对性能、延迟与定制化的综合需求。TuringViT从架构、数据、训练三个维度同步突破,打造了完整技术体系,实现了效果、效率与落地性的三重提升。
随着TuringViT的发布,小鹏全栈自研的物理AI底层技术能力逐步完善。据悉,该能力不仅服务于智能辅助驾驶,更将赋能更多物理AI业务场景,包括让高分辨率感知落地车端、升级座舱交互以及为人形机器人打造通用视觉能力。

粤公网安备 44010602000162号
网友评论