2020年,GPT-3靠“看几个示例就会新任务”震动了NLP界;六年后的今天,同样的故事正在具身智能领域上演。
没错,就是In-Context Learning。
8月中旬,Skild AI发布机器人基础模型S1。只需要给机器人看一遍任务演示视频,它可以在不微调、不做额外post-training的情况下,尝试完成此前没有训练过的新任务。任务时长可达10分钟,包含几十个操作步骤。
Skild在(训练数据)见过的任务和未见过的任务上,对比了ICL视频Prompt和传统的语言Prompt VLA。
测试结果表明,当训练数据只有1000小时时,语言Prompt效果更好,而随着数据规模增加,ICL开始反超。对于未见任务,加入视频context后,模型表现相比只用语言指令提升约7倍。
S1发布的一周之前,Generalist AI发布GEN-1.5,同样把One-Shot Learning作为核心能力。机器人只看一个示范,就能在数秒内学习新任务,无需梯度更新或微调,并支持人类示范到机器人执行、组合泛化和Sim-to-Real迁移。
这两项进展都是在尝试让机器人学会利用更长的多模态Context。
In-Context Learning(ICL)这条路径,已经在LLM领域被验证、并成为至关重要的一环。
2020年,OpenAI在GPT-3的论文Language Models are Few‑Shot Learners中提出ICL,定义它是一种能力——不给模型做任何参数更新(没有微调、反向传播训练),仅在输入prompt中提供若干任务示例(demonstrations/examples),模型在单次前向推理过程中就能够识别并执行该新任务。
0
评论 (0)