FailBench:VLM 判断机器人任务成功有多可靠?
原标题:FailBench: How Reliable are VLMs at Judging Robot Task Success?
技术动态AI 82
来源:arXiv cs.RO发布时间待核实
arXiv:2609.03611v1 Announce Type: new Abstract: Vision-Language Models (VLMs) are increasingly used to evaluate robot manipulation outcomes, but existing benchmarks offer limited evidence of cross-domain generalization. We introduce FailBench, a benchmark for robot failure detection comprising 2,197 manipulation attempts across 14 public sources (12 real-world, 2 simulated). In FailBench, 75% of failures occur naturally, and six real-world sources come from non-failure-detection datasets.