Embodied AI and VLA: How Large Models Grow a Body
过去几年,大模型的"大脑"主要在数字世界里工作:写文字、生成图片、调用软件接口。而具身智能(Embodied AI)想做的事不太一样——让模型拥有一具身体,能在真实物理世界里感知、移动和操作。一、从"看懂"到"动手":VLA 是什么VLA(Vision-Language-Action)指把视觉、语言与动作统一进同一个模型:输入摄像头画面和一句自然语言指令(例如"把桌上的杯子递给我"),输出的是机器