【资料图】
视觉骨干网络是机器视觉系统的核心模块,直接决定分类、检测、分割等下游任务的上限。过去十余年,视觉架构经历了手工特征、CNN主导、ViT兴起到当前融合发展的四个阶段,CNN与ViT成为最具代表性的两代技术路径。
一份研报观点认为,CNN通过局部连接、权值共享和平移不变性等视觉归纳偏置,在数据相对有限的情况下展现出更高效率,更适合端侧实时部署;而ViT利用自注意力机制实现第一层全局交互,弱先验强规模化特点使其在大规模预训练下上限更高。研报指出,虽然ViT在多模态大模型如CLIP、Qwen-VL中成为主流,但ConvNeXt等纯卷积模型结合现代训练技巧已能追平部分ViT性能,表明视觉架构正走向任务、数据、算力约束下的动态平衡。
研报认为,产业落地呈现明显分层,多模态大模型和研究前沿偏好ViT类视觉编码器,而自动驾驶量产系统受算力、时延和安全要求影响,更多采用CNN前端加BEV与Transformer融合的混合架构。数字AI底座发展路径已逐渐清晰,但难以完成物理世界建模闭环。相比之下,物理AI有望成为当前AI阶段增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,其确定性正在快速提升,相关产业链投资价值值得重点关注。
上一篇:广西南宁:暑期带火“夜经济”
下一篇:最后一页
7月30日,生意社PC基准价为13983 33元 吨,与本月初(12966 67元 吨)相
微软交出亮眼成绩单!从Anthropic投资中获32亿美元收益,对OpenAI投资
巴尔德:我仍有提升空间;阿尔巴是巴萨队史最好的边后卫,巴萨,阿尔巴,
格隆汇7月29日丨澜起科技(06809 HK)公告,2026年7月29日耗资人民币1 03
武威古称凉州。盛夏时节,甘肃省武威市的市政公园繁花盛放,各色花海次
X 关闭
X 关闭