- BeyondMimic は人型ロボットが高難度動作を個別訓練なしに実行することを可能にする。
- このシステムは人間のデモンストレーションから学習し、異なるスキルを自然に切り替えることができる。
- 研究によると、BeyondMimic が生成する動作は人間に近く、観察者の好感度が高い。
- このフレームワークは、人型ロボットが新しいスキルを再訓練なしに学習する可能性を切り開いた。
研究チームは最近、BeyondMimic という新しいフレームワークを発表し、人型ロボットが機敏で人間に近い動作を実行し、複数のスキルをスムーズに切り替えることを可能にした。このシステムは、ロボットが側転、旋回キック、さまざまなスポーツ動作やサーカス演技などの複雑な動作を完了することを可能にし、各タスクに対して個別に訓練する必要がない。BeyondMimic は人間の動作データから学習し、学習した動作を新しいタスクや環境に適用することができる。研究チームは、この方法が既存の制御システムの限界を解決する可能性があるとしている。既存のシステムは多くの微調整を必要とするか、不自然でぎこちない動作しか生成できないことが多い。
BeyondMimic モデルは、人型ロボットが人間のデモンストレーションから機敏で人間に近い動作を学び、これらのスキルを組み合わせて、明示的に訓練されていないタスクを実行することを可能にする。このシステムは人型ロボット分野における重要な課題に対処する。ロボットは歩く、跳ぶ、蹴るなどの個々の動作を学ぶことができるが、異なるスキル間を自然に切り替えることは依然として非常に困難である。既存の手法は通常、特定の動作に対して報酬関数を設計したり、多くの調整を行ったり、各タスクに対して別々に訓練する必要がある。BeyondMimic はこの制限を克服するために、二段階学習フレームワークを採用している。
二段階学習フレームワークの活用
第一段階では、研究チームは強化学習(RL)を用いてロボットにさまざまな人間の動作を追跡するよう訓練する。重要な点は、チームが単一の動作追跡式、共有報酬構造、および共通のハイパーパラメータを採用し、各動作に対して個別にシステムを調整する必要がないことである。
研究チームは、約2.5時間の多様な人間の動作データを使用してシステムを訓練し、数百のスキルを習得させた。これには、通常の歩行とランニング、片足バランス、跳躍、ダンス動作、武道にインスパイアされた動作、旋回キック、側転などが含まれる。その後、研究チームは21の代表的な動作セグメントを実際の人間型ロボットに展開し、シミュレーショ環境で学んだことをハードウェアに移行できることを証明した。第二段階では、潜在拡散モデル(latent diffusion model)を導入し、BeyondMimic に動作を生成および組み合わせる能力を付与した。
このモデルは、単に学習済みの動作シーケンスを再生するのではなく、状態と動作軌跡の基盤となる分布を調整することを学ぶ。研究チームによると、変分オートエンコーダー(variational autoencoder)がまずこれらの動作を圧縮してより滑らかな潜在表現にし、その後、拡散モデルがこれらの表現の進化の仕方を学ぶ。
スキルの生成と調整能力
研究チームは推論段階で分類器誘導(classifier guidance)技術を用いて、拡散モデルを訓練段階でカバーされていない目標に向かって誘導し、ロボットが基盤となる戦略を再訓練したり微調整したりせずに既存のスキルを調整できるようにした。例えば、システムはジョイスティックコマンドを受け取って対応する歩行やランニング動作を生成することができる。また、指定されたウェイポイントに移動したり、障害物を避けたり、疎な未来のキーフレームに基づいて完全な遷移動作を生成したりすることもできる。あるデモンストレーションでは、ロボットが歩行から側転にスムーズに移行し、その後再び歩行状態に戻る動作を実行した。また、側転と歩行、ランニングを交互に組み合わせた動作シーケンスも実行した。
この方法は、複数の目標を同時に組み合わせることもでき、例えば、ウェイポイント追跡と障害物回避コストを統合して、ロボットが目標に向かって進むと同時に障害物を迂回できるようにする。同様のフレームワークで、ジョイスティック制御と衝突回避を組み合わせて使用することもできる。実際のロボットは、空中の側転、旋回キック、フリップキックなどの高度にダイナミックな動作を披露した。空中の側転中、ロボットのピーク加速度は31 m/s²に達し、骨盤の最大角速度は15.7 rad/sに達し、文献で報告されている熟練した人間の空中動作の数値に匹敵する。
機敏性に加えて、研究者たちはシステムが生成する歩行やランニング動作が人間の観察者にとってより自然であることを発見した。77人の参加者を含むある研究では、BeyondMimic が生成する動作が70.8%の選択で、ロボットのネイティブコントローラーよりも人間に近く自然であると評価され、ネイティブコントローラーはわずか29.2%の好まれ度だった。研究チームは、核心的な突破点は単一の新しいコンポーネントではなく、スケーラブルな動作追跡、潜在拡散モデル、および推論段階での誘導技術の統合にあると述べている。
スキル獲得とタスクの分離
スキル獲得とタスク仕様の分離により、BeyondMimic は人型ロボットに大量の人類の動作ライブラリを学習し、特定のタスクに対して再訓練することなくスキルを再組み合わせることで新しい状況に対応するための道を開いた。
項目 仕様/データ フレームワーク名 BeyondMimic 学習方法 二段階(強化学習 + 潜在拡散モデル) 訓練データ時間 約2.5時間の人類動作データ 学習済みスキル数 数百 実機ロボットに展開された動作セグメント数 21 空中側転のピーク加速度 31 m/s² 骨盤の最大角速度 15.7 rad/s ユーザー研究参加者数 77人 BeyondMimic 動作の好み割合 70.8% ネイティブコントローラーの動作の好み割合 29.2%
BeyondMimic がロボット技術に与える影響
BeyondMimic フレームワークの開発は人型ロボット技術における重要な進歩を象徴している。従来、ロボットは各スキルに対して個別に訓練する必要があり、これは時間がかかり、柔軟性を制限していた。強化学習と潜在拡散モデルを統合することにより、BeyondMimic は人類の動作から学習し、さまざまな状況で迅速に適応することができ、これによりロボットが現実世界の応用における実用性が大幅に向上する。また、生成される動作がより自然であることは、未来の人型ロボットが社会の中で果たす役割にとって重要である。
