斯坦福博士生 Perry Dong 与导师 Chelsea Finn 提出面向机器人的通用后训练思路。预训练模型已能完成复杂任务,却卡在可靠性上:95% 的成功率放进有玻璃、宠物和孩子的家庭,剩下的 5% 仍会不断制造事故,机器人要学的是稳定把事做对。 近日,斯坦福大学计算机科学博士生 Perry Dong 与导师 Chelsea Finn 发布长文《Towards Universal...
斯坦福博士生 Perry Dong 与导师 Chelsea Finn 提出面向机器人的通用后训练思路。预训练模型已能完成复杂任务,却卡在可靠性上:95% 的成功率放进有玻璃、宠物和孩子的家庭,剩下的 5% 仍会不断制造事故,机器人要学的是稳定把事做对。 近日,斯坦福大学计算机科学博士生 Perry Dong 与导师 Chelsea Finn 发布长文《Towards Universal...