编者按
新加坡国立大学广州创新研究院(以下简称“研究院”)博士奖学金由广州市黄埔区提供,目标是依托新加坡国立大学(以下简称“新国大”)丰富优质的教育资源,为广州市黄埔区培养和输送具有全球视野、掌握前沿科技知识、能充分应对21世纪挑战的高素质博士人才。我们将在本栏目持续更新学子们在新国大的进步与收获,记录这些青年学者的成长轨迹。
近日,新国大广州创新研究院博士奖学金得主、新加坡国立大学计算机学院计算机科学专业博士三年级研究生陈浩楠同学,参与完成的具身智能领域研究成果入选机器人领域顶级国际会议 IEEE International Conference on Robotics and Automation(ICRA 2026)。该研究提出了一种基于目标状态生成的机器人学习框架 Goal-VLA,通过利用视觉语言模型理解任务目标,并结合三维视觉与机器人控制技术,实现机器人在无需针对特定任务进行额外训练的情况下完成多种操作任务,为提升机器人泛化能力探索了新的技术路径。
不同于传统直接从语言指令预测机器人动作的方法,该研究尝试将“理解任务目标”和“执行具体动作”进行解耦,让机器人首先理解任务完成后的状态,再根据具体机器人结构和环境规划执行方式。这一思路有望降低机器人对大量动作示范数据的依赖,为未来通用机器人、家庭服务机器人以及智能制造等领域的发展提供新的探索方向。
学子专访

陈浩楠,新加坡国立大学计算机学院计算机科学专业博士三年级研究生,新加坡国立大学广州创新研究院博士奖学金得主,他的导师是新国大广州创新研究院PI(Principal Investigator,学术带头人)、新国大计算机学院助理教授、具身智能企业RoboScience(机器科学)联合创始人兼首席科学家邵林助理教授。
陈浩楠本科毕业于南京大学计算机科学与技术系。本科阶段接触计算机科学研究后,他逐渐对人工智能与机器人交叉领域产生兴趣,并进入新加坡国立大学继续攻读博士学位。
目前,他主要从事具身智能、世界模型以及机器人操作方向研究,关注如何将大模型所具备的语义理解和推理能力,转化为机器人在真实物理环境中能够执行的动作。
他希望相关研究能够帮助机器人适应更多未曾训练过的任务、物体和环境,降低通用机器人对大规模人工采集动作数据的依赖,让机器人更加自然地融入真实世界。
Q:为什么会选择具身智能和机器人方向?
近年来,大语言模型和视觉语言模型展现出了令人惊叹的能力。它们能够理解复杂文本、分析图像内容,并掌握大量来自互联网的数据知识。但对于机器人而言,仅仅理解语言和图像并不足够。例如,当人告诉机器人“把瓶子立起来”时,机器人不仅需要理解这句话的含义,还需要知道应该操作哪个物体、物体最终应该处于什么状态,以及机械臂应该如何移动才能完成任务。这其中涉及视觉理解、空间感知、任务规划以及机器人控制等多个层面的问题。
我本科阶段学习计算机科学,也一直对人工智能如何影响现实世界产生兴趣。相比只存在于虚拟环境中的智能系统,我更希望研究能够真正与物理世界交互的人工智能,让机器不仅能够处理信息,也能够执行任务。
因此,我逐渐将研究兴趣聚焦于具身智能,希望探索如何让机器人具备更强的理解能力和泛化能力。
Q:你的研究如果能改变世界的一小部分,你希望它改变什么?
我希望未来的机器人能够更容易理解普通人的需求,而不是要求普通人学习如何为机器人编程。
目前,大多数机器人仍然只能在比较固定的环境中执行预先训练或者预先编写好的任务。一旦物体、任务要求或者场景发生变化,往往需要专业人员重新配置系统、重新采集数据或者重新训练模型。
这也是为什么现在的机器人虽然已经在一些工业场景中得到应用,但距离真正进入普通人的日常生活仍然有很大距离。
我希望自己的研究能够缩短人类意图和机器人行动之间的距离。人可以通过自然语言、图像或者简单示范,告诉机器人希望达到什么结果。机器人则能够理解当前环境,预测任务完成后的目标状态,并将这个目标转化为可以执行的动作。
这种能力最开始可能只能帮助机器人完成一些具体任务,例如整理桌面、摆放物品、完成重复实验操作,或者让工厂机器人更快适应新的产品和工序。
但是从长期来看,我希望机器人能够承担一部分危险、重复或者耗费精力的劳动。
我并不认为机器人的价值只是替代人,而是希望它能够成为人类能力的延伸,在人不方便、不安全或者不值得投入大量时间的地方提供帮助。
Q:请分享一下目前的读博体验,你觉得博士生活和你之前预想的一样吗?
读博之前,我对科研的理解相对线性。我原本觉得,科研大致是先找到一个问题,然后提出方法、完成实验,最后把结果写成论文。真正开始读博以后,我发现科研往往不是一个线性的过程。一个项目可能在开始时看起来很合理,但做完一些实验以后,才发现最初的假设并不成立;也可能投入了很多时间实现系统,最后发现真正需要解决的问题与一开始设想的不完全一样。
我觉得博士阶段最意想不到的挑战,不只是把一个模型实现出来,而是要不断判断什么问题值得研究,以及现有实验究竟能够支持什么结论。尤其是在机器人研究中,一个实验失败可能有很多原因。它可能来自模型,也可能来自相机标定、目标分割、深度估计、点云配准、运动规划或者机械臂执行。如果不能判断错误发生在哪一个环节,就很难知道下一步应该改模型、改数据,还是改整个问题定义。
博士阶段还需要同时学习研究问题定义、代码实现、实验设计、论文写作、团队合作和项目管理。这些能力都很重要,但在读博以前,我并没有完全意识到它们之间联系得这么紧密。
读博过程中的惊喜,是能够看到一个最初只存在于想法中的系统,最终真的在机器人上运行起来。
当机械臂根据我们设计的方法完成一个之前没有专门训练过的任务时,这种反馈非常直接,也让我感受到机器人研究的吸引力。
另外,我觉得博士阶段给我带来的一个重要变化,是逐渐学会在信息不完整、结果不确定的情况下继续做判断。很多时候,我们不可能等到所有证据都充分以后再开始研究,而是需要一边实验,一边修正自己对问题的理解。
Q:导师和实验室团队对你产生了怎样的影响?
导师和实验室对我最大的影响,是让我逐渐从关注“能不能把一个方法做出来”,转向思考“为什么要研究这个问题,以及什么样的实验才能真正说明这个方法有效”。
我的导师邵林教授在研究方向、问题定义和项目推进方面给了我很多指导,也给了我比较充分的探索空间。
在研究初期,我可能会更加关注模型结构、代码实现和实验结果。随着项目经验增加,我逐渐意识到,一个研究项目的价值不仅取决于系统是否能够运行,还取决于问题定义是否清楚、方法是否真正解决了核心瓶颈,以及实验是否排除了其他可能的解释。Goal-VLA并不是一个只依靠单一模型就能完成的项目。它涉及高层图像生成、视觉语言理解、三维空间定位和真实机器人执行,任何一个模块的问题都会影响最终结果。因此,这项工作非常依赖团队成员之间的合作。
我特别感谢共同第一作者郭京翔,以及参与这项工作的所有合作者。
项目中有很多工作不会完整体现在论文里,例如反复调试机器人、检查硬件状态、重新采集实验、分析失败案例以及修改系统接口。正是这些具体而细致的工作,使一个概念最终变成了能够在真实机器人上运行的系统。
我也感谢新加坡国立大学广州创新研究院博士奖学金提供的支持。这份支持让我能够更加专注地开展博士研究,并参与不同学校和研究团队之间的合作。
Q:请给刚入学的博士学弟学妹们一些建议。
我的第一个建议,是尽早区分完成一项技术工作和回答一个研究问题之间的区别。
实现一个模型、搭建一个系统或者取得一个更高的实验指标都很重要,但还需要进一步解释:现有方法为什么不能解决这个问题,自己的方法改变了什么,以及实验究竟验证了哪一个判断。
第二个建议是,不要一开始就试图完成一个过于宏大的研究目标。
一个大的研究方向通常可以拆成很多更小的问题。可以先设计规模较小、成本较低的实验,验证最关键的假设是否成立。如果一个假设本身不成立,越早发现,后续浪费的时间就越少。
我的第三个建议是,尽量如实分析实验结果。
科研并不是把每一个结果都解释成成功。一个方法可能在某些任务中有效,在另一些任务中无效;可能解决了一个问题,但又暴露出新的限制。清楚说明方法在什么条件下有效、在哪些情况下会失败,通常比提出一个范围很大但证据不足的结论更有价值。
第四个建议是,主动与导师和同学沟通,但在沟通之前,最好先整理好自己的问题。
可以先说明自己已经尝试了什么,目前有哪些实验结果,自己倾向于哪一种解释,以及最不确定的地方是什么。这样不仅能够提高沟通效率,也能够帮助自己更加清楚地理解问题。
第五个建议,是不要把一次投稿结果或者短期论文数量,当作衡量自己全部能力的标准。
科研结果会受到研究方向、资源、合作方式和时间节点等多种因素影响。论文当然重要,但博士阶段更长期的目标,是逐渐形成独立定义问题、设计实验和判断证据的能力。
最后,我认为保持基本的生活秩序也很重要。博士阶段通常持续几年,研究中的不确定性很难完全消失。规律睡眠、适当运动、与家人朋友保持联系,以及保留一些科研之外的生活,并不是浪费时间,而是维持长期研究状态的一部分。博士阶段不只是完成几篇论文,也是在学习如何面对长期的不确定性,并在不断失败、调整和重新判断的过程中继续推进工作。
研究介绍
Goal-VLA:利用世界模型提升机器人泛化能力
01 研究背景与意义
当前机器人学习领域的重要目标之一,是让机器人能够面对更多开放环境和未知任务。
传统机器人系统通常需要针对具体任务采集大量动作数据,并学习从视觉观察和语言指令直接预测机器人动作。
这种方法能够实现端到端学习,但也存在明显挑战:首先,机器人动作与具体硬件高度相关。不同机械臂、不同末端执行器,其动作空间和控制方式可能完全不同。其次,高质量机器人动作数据采集成本较高,很难像互联网文本和图像数据一样大规模获取。
因此,即使视觉语言模型已经具备较强的知识理解能力,将其进一步转化为机器人操作能力仍然面临数据和泛化方面的限制。
Goal-VLA 希望探索一种新的思路:机器人不直接学习“应该怎样运动”,而是先理解“任务完成后,世界应该变成什么样”。例如:当任务是“把瓶子立起来”时,机器人首先需要理解瓶子的最终姿态;当任务是“把番茄放进锅里”时,机器人首先需要理解番茄最终应该处于锅中的状态。之后,再由空间计算模块和机器人控制模块完成具体动作规划。
02 Goal-VLA的整体方法

Goal-VLA的输入包括一张单视角RGB-D图像和一条自然语言指令。
RGB图像提供场景的颜色和外观信息,深度图则提供每个像素对应的距离信息。系统最终输出机械臂可以执行的运动轨迹。
整个系统可以分为三个主要阶段。第一个阶段是目标状态生成。

系统使用图像生成式视觉语言模型,根据当前图像和任务指令生成一张任务完成后的目标图像。这张图像主要描述目标物体最终应该处于什么位置和姿态。
第二个阶段是空间定位。

系统比较初始图像和目标图像,建立目标物体表面像素之间的对应关系,再结合深度信息,将二维像素对应关系转换为三维点之间的对应关系。之后,系统通过三维点云配准,估计目标物体从初始状态到目标状态所需要的旋转和平移。
第三个阶段是机器人执行。

系统根据物体的三维目标变换确定末端执行器的目标位姿,并调用运动规划器生成机械臂的无碰撞轨迹,完成抓取、移动或放置等操作。
这种设计使不同模块承担各自更加擅长的任务。图像生成式视觉语言模型负责理解语言和预测任务结果,但不需要直接输出精确的三维坐标。三维视觉模块负责空间匹配和几何计算,而机器人控制模块负责将目标位姿转化为可执行动作。
03 核心创新点
1 将目标状态作为连接语言理解和机器人执行的桥梁
Goal-VLA 提出了一种目标状态驱动的机器人操作框架。系统首先根据当前环境和语言指令生成任务完成后的目标图像,然后分析目标物体需要发生的空间变化,最后转换为机器人能够执行的运动。这种方式避免了让视觉语言模型直接输出机械臂动作,而是让不同模块发挥各自优势:视觉语言模型负责理解任务和预测目标状态;三维视觉模块负责空间计算;机器人控制模块负责执行动作。这种模块化设计提升了系统在不同机器人平台之间迁移的可能性。
2 提出 Reflection-through-Synthesis 目标反思机制
图像生成模型虽然具有较强的语义理解能力,但生成结果可能并不完全符合真实任务要求。例如,在“把番茄放进锅里”的任务中,模型可能错误改变锅的位置,或者生成一个新的锅,而不是操作原场景中的目标物体。

针对这一问题,研究提出 Reflection-through-Synthesis 机制。系统会检查生成目标状态是否符合原始场景约束,并根据视觉语言模型反馈不断修正目标描述,提高目标状态生成的可靠性。
3 实现从二维目标图像到三维机器人动作的转换
生成目标图像后,机器人仍然需要知道物体在真实空间中的变化方式。研究进一步结合 RGB-D 信息,通过视觉特征匹配和三维点云计算,将二维图像中的目标变化转换为三维空间中的旋转和平移关系。最终,机器人能够根据这些信息规划末端执行器运动轨迹,实现抓取、移动和放置等操作。
04 实验验证

研究团队分别在仿真环境和真实机器人平台进行了实验验证。
在仿真实验中,研究采用 RLBench 机器人操作环境,对抓取、放置、插入、姿态调整等多类任务进行了测试。实验结果显示,在无需针对测试任务额外训练动作策略的情况下,Goal-VLA 能够完成多种机器人操作任务,并在零样本泛化能力方面展现出一定优势。
在真实机器人实验中,研究团队利用七自由度机械臂和 RGB-D 相机测试了多个任务,包括:将番茄放入锅中;使用工具清扫桌面;将玩具鸭放置于称重设备上;将水平放置的瓶子立起来。

实验结果表明,该方法能够在不同类型任务中完成机器人操作,为提升机器人面对未知任务时的适应能力提供了一种新的探索方向。
05 研究价值与未来展望
Goal-VLA 的核心价值,是探索了一条不同于传统直接预测动作的机器人学习路径。机器人未来要真正进入复杂开放环境,仅依靠针对每一个任务采集大量数据是不现实的。
如果机器人能够先理解任务目标,再根据环境和自身结构生成执行方案,就有可能降低新任务学习成本,提高机器人适应能力。
目前,这项研究仍处于实验室探索阶段,但它可能为家庭服务机器人、智能制造、实验室自动化等领域提供新的技术思路。
团队介绍

陈浩楠同学的导师是新加坡国立大学计算机学院计算机科学系邵林助理教授。他博士毕业于斯坦福大学,研究方向主要位于机器人学与人工智能的交叉领域。邵林助理教授及其团队的长期研究目标,是构建能够在复杂物理环境中完成多种任务的通用机器人系统,重点研究如何赋予机器人更强的感知和操作能力。
邵林助理教授带领团队连续两年斩获 ICRA 最佳论文/提名,是近5年亚洲唯一获此殊荣的团队。
邵林助理教授带领的LinS Lab主要围绕机器人学习、机器人感知与机器人操作开展研究,具体涉及通用机器人操作、灵巧抓取、跨机器人本体泛化、世界模型以及具身智能系统等方向。实验室既关注算法和表示方法,也重视在仿真环境与真实机器人平台上对完整系统进行验证。
实验室的代表性工作之一是D(R,O) Grasp。这项工作提出了一种统一描述机器人手与物体交互关系的表示,使同一个模型能够根据不同机器人手的结构和物体几何形状,生成稳定且符合运动学约束的灵巧抓取姿态,从而提升抓取方法在不同机器人手之间的泛化能力。该工作获得了 ICRA 2025机器人操作与运动最佳论文奖(Best Paper Award on Robot Manipulation and Locomotion)。
感谢陈浩楠同学的分享。期待他和团队在具身智能与机器人领域持续探索,推动人工智能从数字世界走向物理世界,为未来智能社会的发展贡献青年科研力量。


