Skip to main content

Niantic Spatial, Flexion, and NVIDIA: Closing the Sim2Real Gap for Humanoids | Niantic Spatial, Inc.

Niantic Spatial and Flexion: Closing the Sim2Real Gap for Humanoids

Niantic Spatial、Flexion、NVIDIA:Sim2Real をよりシームレスに

日付:7/20/2026
著者:Co-authored by Niantic Spatial and Flexion
カテゴリ:
Featured News
ロボティクス

ヒューマノイドロボットに歩行や移動といった基本的なスキルを習得させる最もスケーラブルな方法は、強化学習(RL)です。しかし現実世界でのRLは容易ではありません。理由は、ロボットは失敗できる余裕がほとんどないからです。わずかな段差の踏み外しやガラスドアへの衝突は、コストがかかり、リセットに時間を要し、ハードウェアの損傷につながります。そのため、学習のほとんどはシミュレーション上で行われます。

多くの企業は、ロボットが現場に足を踏み入れる前に、シミュレーションで訓練されたポリシーが現実世界の現場でも問題なく機能するかを確認するにはどうしたら良いのかという問いを持ちます。その解は、その現場のデジタルツイン上でトレーニング・テスト・評価を行うことです。これにより、新しい場所ごとにスキルを迅速に適応させることも可能になります。

その方法として、まずは予定している現場を標準的なRGBカメラでスキャンし、Niantic Spatial Scaniverse にて高品質なデジタルツインを3D再構築します。次に開発者はNVIDIA Isaac SimおよびIsaac Labのオープンソースシミュレーション・学習フレームワークを使ってロボットをシミュレート・トレーニングします。そしてFlexionが特定ハードウェアに最適化されたポリシーとデプロイソフトウェアを提供することで、ゼロショットで現実世界に転移します。

Niantic SpatialとFlexionはこのパイプラインをエンドツーエンドで提供します。Gaussian Splatによるフォトリアリスティックなレンダリングを使用し、シミュレーション環境でトレーニングされたRGBのみのローカルナビゲーションポリシーが、実際のオフィスにゼロショット転移できるというものです。この結果は、レンダリングのスピードと品質がRLベースのポリシーを数時間でトレーニングするのに十分であることを示しており、推論や操作を含む垂直統合システム全体のトレーニングへの応用も将来的に期待されます。

ロボットは学習のために、シミュレーション空間で失敗する必要がある

シミュレーションは、ロボットが失敗を重ねられる場所です。強化学習では、ポリシーは試行錯誤を通じて改善されます。アクションを取り、報酬を観察し、調整する—その繰り返しを数百万回行い、そのほとんどは安定した動作が得られるまで失敗し続けます。実機のロボットはそれに耐えられませんが、シミュレーションなら高速・安全・大規模に並列でトレーニングすることが可能です。数千台の仮想ロボットが同時に、リアルタイムより速く、傷一つつかずに練習できるのです。しかし、シミュレーションでのトレーニングが真の価値を生むのは、そのふるまいが現実世界に転移できる場合に限られます—これがsim2realロボティクスの核心的な課題です。

現代のシミュレーションファーストなロボットトレーニングへの道

ロボティクスにおける現代の強化学習は、GPUアクセラレーションによるシミュレーションに依存しており、物理エンジンとトレーニングループを数千の並列環境にわたってスケールさせることができます。[Rudin et al., 2022] NVIDIA Isaac SimやIsaac Labといったプラットフォームが、この種の大規模ロボットトレーニングのコアインフラを提供しています。

これらのシミュレーション環境の中で、センサー入力が豊かになるにつれてロボットポリシーも進化してきました。初期の強化学習システムは主に自己受容感覚に依存し、関節フィードバックと接触力を使って地形を走破していました [Lee et al., 2020]。

次の波では外受容感覚—高さスキャン・深度マップ・LiDAR—が加わり、接触前に地形を予測できるようになりました。この転換により、不整地での堅牢な歩行 [Miki et al., 2022],、高速なアジャイル動作[Hoeller et al., 2024]、シミュレーション内でのエンドツーエンドナビゲーション[Yang et al., 2025]が実現しました。

A typical massively parallel training environment for humanoid navigation from raw depth information. The navigation goal location is visualized with a red arrow. The simulation relies entirely on randomized untextured structures.

次のステップはRGBであり、それはヒューマノイドがすでに搭載しているセンサーです。カメラはコスト効率が高く、どこにでもあり、広い視野を持ち、ステレオ深度と比べてハードな失敗ケースが少ない状態で幾何学とセマンティクスの両方を暗黙的にエンコードします。この追加情報こそがスケールアップの余地になり得ます。

しかし、これらのトレーニング環境は依然としてランダム化されたテクスチャなしの幾何学的シーンから構築されています。深度は比較的正確にシミュレートしやすいため、これが標準であり続けています。しかしそれと同時に、ロボットの知覚を構造的な輪郭だけに制限し、素材・セマンティクス・物体が実際に何であるかを見えなくしています。だからこそRGBが知覚ロボットポリシーの次のステップなのです。シミュレーション画像が現実世界に転移できるほどリアルであれば、ヒューマノイドのナビゲーションシステムに幾何学とシーンの意味の両方へのアクセスを与えられます。

ソリューションを構成する二つの要素

1つ目は real2sim: 世界の見た目と物理的な振る舞いの両方を、現実をシミュレーターに忠実に取り込むことです。現実世界を高品質でレンダリング・シミュレーション可能なコピーに変換することが私たちの強みです。

2つ目は sim2real: その不完全な合成環境でトレーニングされたポリシーを、ロボットの実機で堅牢に動作させること。このギャップを埋めることがFlexionの強みです。

real2simとsim2realの両方において、ビジョンは最も難しい要素です。一方で深度は歴史的にシミュレートしやすいものでした。レンダリングされた深度画像は実測のものと概ね類似して見え、そのノイズも直接モデル化できるからです。RGBはより要求が高く、色・照明・テクスチャのわずかな誤差でシーンはまったく別の場所のように見えてしまい、リアルなシミュレーションと堅牢なポリシー転移の両方が難しくなります。

では、なぜ再構築されたシーン内でRGBロボットポリシーをトレーニングするのでしょうか?第一に、RGBは今も、そして今後も多くのロボットが搭載するセンサーです。カメラは低コストで広く普及しており、ステレオ深度センサーよりも広い視野を持つことが多く、RGBは幾何とセマンティクスの両方を暗黙的にエンコードします。意味情報が形状と同様に重要な現実世界の環境では、RGBベースのロボットポリシーは深度だけの場合より拡張性を持ちます。

第二に、特化することは能力を解放します。ロボットが稼働する予定の場所のデジタルツイン内でポリシーをトレーニングすることで、視覚的構造・素材・制約に適応させることができ、汎用ポリシーでは達成が難しい動作を実現します。

ただsim2real転移を機能させるには、トレーニング画像がリアルに見える必要があります。具体的には、フォトリアリスティックな合成アセットか、より直接的な手段として現実シーンの忠実な3D再構築が必要です。3D再構築がRGBポリシーの自然な居場所となる理由はここにあります。 この課題は2つのパートに分けられます。ひとつは、学習に十分なほど忠実なトレーニング環境の構築。もうひとつは、トレーニング環境から転移できるほど堅牢なポリシーのトレーニングです。 このブログでは、ローカルナビゲーションを具体例として両方を解説します。まずNiantic Spatial が構築する環境、次にFlexionがその中でRGBナビゲーションポリシーをトレーニング・デプロイする方法という順で進めます。

Part 1:Niantic Spatialのreal2sim - 一周歩くだけでトレーニングに十分な環境を

ポリシーの質は、トレーニング環境から得られる観測の質に依存します。sim2real転移を機能させるには、再構築されたシーンが2つの側面で同時に忠実である必要があります。現実の場所のように見えること(幾何・素材・照明)と、物理法則に従って動作すること。両方の要件を満たすには通常、フォトリアリスティックなレンダリングレイヤーと物理用のコリジョンメッシュが必要で、3D再構築の品質は両者の整合性に依存します。レンダリングされた壁とコリジョンの壁が数センチずれていると、ビジョンポリシーは見えている障害物をすり抜けることや、存在しない障害物を避けることを学習し、そのキャリブレーションのずれを実機ロボットに持ち込みます。Niantic Spatial のパイプラインは両レイヤーを同じ3D再構築プロセスから導出するため、設計上一致します。

一周歩くだけで現場をキャプチャ

市販の360°カメラによる数分間の現場の映像があれば、トレーニング対応デジタルツインを作成できます。作業者はLiDARも三脚も専門的なキャプチャプロセスも不要で、空間を一周歩いて回るだけでキャプチャを行うことができます。このパイプラインはシーンをメートルスケールで復元するため、ロボットは距離と速度をメートル単位で学習でき、あらゆるアクションに伝播するスケール誤差を回避できます。

そのキャプチャした情報は、シミュレーションの視覚レイヤーになります。Niantic Spatial はカメラのポーズを推定し、任意の視点からフォトリアリスティックなRGBビューを提供する3D Gaussian Splatを学習させます。これにより、キャプチャ時の照明・素材・乱雑さが現実環境のまま保持されます。これはRGBロボットトレーニングにとって重要です。汎用合成アセットとは異なり、忠実な再構築はポリシーにsim2real転移に必要な視覚的リアリズムを提供します。また、倉庫やオフィスなどの現場をキャプチャすることは、新しい現場ごとに工数をかけ合成モデルを構築するよりも運用しやすいため、拡張性にも優れています。

同じ3D再構築からジオメトリを導出

物理レイヤーも、同じ3D再構築から導出します。ジオメトリを別のパイプラインで構築するのではなく、3D再構築自体からコリジョンメッシュを生成する設計です。その際に使用するのがMVSAnywhereです。異なるドメインや深度範囲にまたがって汎化できるよう設計されたゼロショット多視点ステレオモデルで、深度推定からメッシュを生成します。このモデルが特に力を発揮するのは、白い壁や低テクスチャな領域——従来の多視点手法ではギャップやノイズの多いジオメトリが生じやすく、カメラポーズを失いやすい箇所——です。フォトメトリックな3D再構築単体と比べて、よりフラットでクリーンなサーフェスを生成できます。

視覚レイヤーとコリジョンメッシュは同じ再構築プロセスから生成されるため、両者は設計上つねにアラインメントを保ちます。ロボットがシミュレーション内で「見るもの」と「衝突するもの」を別々に合わせる相互レジストレーションのステップが不要になり、sim2realの主要な誤差原因がひとつ排除されます。レンダリングされた壁とコリジョンの壁がほんの数センチずれているだけで、ヒューマノイドは見えている障害物をすり抜けたり、実際には存在しない障害物を避けたりすることを学習してしまいます。単一の3D再構築設計はこのずれを後から補正しようとするのではなく、そもそも生じないようにします。

Comparing NerfStudio splats (left) to Niantic Spatial splats (right).

NVIDIA Isaac Sim対応のUSDZをエクスポート

スプラットとメッシュは、NVIDIAのNuRec ボリューム仕様に準拠した単一のUSDZにパッケージ化され、NVIDIA Isaac SimおよびIsaac Labに直接ロードできます。このワークフローでは、スプラットがRTXパイプライン経由で視覚シーンとしてレンダリングされ、メッシュはロボットが立ったり衝突したりする不可視の物理プロキシとして機能します。エクスポートされるファイルは重力方向整列済み・メートルスケール・コライダー設定済みの状態で提供されるため、手動での変換・再配向・コライダー設定なしにトレーニングをすぐに開始できます。

エンドツーエンドワークフロー: 360°キャプチャからロボットシミュレーション用トレーニング対応デジタルツインまで

  1. キャプチャ: 市販の360°カメラで実際の現場を一周し、3D再構築に必要な視覚データを収集します。

  2. 3D再構築 : パイプラインがカメラポーズを推定し、フォトリアリスティックな3D Gaussian Splatをトレーニングし、整合されたコリジョンメッシュを導出して、環境に忠実なデジタルツインを作成します。

  3. エクスポート: 視覚スプラットと物理メッシュが、重力方向整列済み・メートルスケール・コライダー設定済みのNuRecボリューム USDZとして単一ファイルにパッケージ化され、シミュレーションの準備が整います。

  4. トレーニング:SDZをNVIDIA Isaac SimおよびIsaac Labに直接ロードすることで、シミュレーションのための大規模ロボットトレーニングのステージとして使用できます。

3D再構築がキャプチャするものとしないもの

あらゆる3D再構築と同様に、トレーニング前に把握しておくべき限界があります。キャプチャはある瞬間を記録するため、照明・反射・オブジェクトの配置はキャプチャ時の状態で固定されます。また静的なシーンを対象とするため、人・ロボット・その他の動的なエージェントはシミュレーション上で後から追加されます。さらに忠実度はカバレッジに依存するため、ウォークスルー中にスキップしたエリアは再構築の品質が低くなります。ただし実際には、これらの限界は以降の結果が示す通り、実機ロボットへのゼロショット転移を妨げません。

ご自身の空間で試してみる

Scaniverseでシーンをキャプチャし、パイプラインを実行して、USDZをIsaac Simにロードしてください。新規ユーザーはコード FLEXYOURSCAN で105,000トップアップクレジットをご利用いただけます。

Part 2:Flexionのsim2realレシピ - シミュレーション内のピクセルから、動作するロボットへ

トレーニングに値する環境ができたことで、幅広いロボットタスクを学習させる扉が開かれました。このブログではFlexion のローカルロボットナビゲーションを取り上げます。事前に構築されたグローバルマップに頼らず、現在のポーズから近くの目標地点へと障害物を回避しながら移動する、短期スキルです。ポリシーへの入力はロボットの搭載カメラ映像・自己受容感覚センサーデータ・自身の座標系で表現された目標で、出力は速度命令です。別途ループ内に組み込まれた事前学習済みの歩行ポリシーが、その速度命令を実際の動作に変換します。カメラで見たものに直接作用するポリシーである以上、シミュレーション内の視覚的リアリズムは重要です。今日の現場におけるほとんどのカメラベースのロボットポリシーは深度を主なインプットとしていますが、Flexionは異なるアプローチを取ります。実際に稼働する現場の3D再構築内でRGBポリシーをトレーニングし、その環境に特化させるのです。

デジタルツイン内での大規模並列ロボットトレーニング

NuRecボリュームとしてIsaac Labにロードすると、1台のGPUで同じデジタルツイン内の大規模並列トレーニングを支えるのに十分な効率でRGBをレンダリングできます。各ロボットはサンプリングされたスポーン姿勢からスタートし、ランダムな目標姿勢を割り当てられます。ナビゲーションポリシーは強化学習を通じて学習します。目標への到達と障害物の回避は報酬となり、衝突や転倒はペナルティとなります。

sim2real のギャップを埋めるためにFlexionが組み合わせるのは、シミュレーションパラメータをまたがるドメインランダム化と、実画像に対してもロバストな特徴量を生成する大規模オフライン学習済み画像エンコーダーです。これらのエンコーダーは、多数の並列トレーニング環境とデプロイ時のロボット上の両方で共通して動作するよう設計されています。この設定により、ターゲットサイトのデジタルツイン内での数百万回のロールアウトが実現し、デプロイ先に特化したロボットナビゲーション行動を習得するのに十分な経験を積むことができます。

以下の2本の動画は、ロンドンのNiantic Spatial オフィスとチューリッヒのFlexionオフィスの3D再構築内で直接トレーニングされたポリシーを示しています。

Video of the training process inside a reconstruction of a Niantic Spatial office. Robots navigate towards their red goal pose markers.
Visualization of the training process inside the Flexion Office reconstruction. Robots navigate towards their red goal pose markers.

実機ロボットにて:3D再構築でトレーニングされたRGBポリシーのゼロショット転移

RGB-only policy purely trained in simulation, navigating the real office toward three commanded target poses.

ポリシーはシミュレーションに留まりません。3D再構築内で完全にトレーニングされたRGBネットワークが実機ロボットに転移し、実際のオフィスをナビゲートします。家具の配置換えなどキャプチャ時との差異があっても有効性を維持し、テストエリアでの通常のナビゲーション時には深度ベースのポリシーと同等のパフォーマンスを発揮します。シミュレーションのみでトレーニングされたRGBのみのポリシーが、ナビゲーション成功に必要な空間理解を獲得できることを示す結果です。

シミュレーション空間での代替アプローチ比較

同じタスクにおいて、シミュレートされた2つの3D再構築されたシーン(FlexionとNiantic Spatialのオフィスの一部)で4つのローカルナビゲーションポリシーを比較しました。設定はセンサーのモダリティとトレーニング環境の組み合わせで異なります。生成されたナビゲーション用テクスチャ無しメッシュ上で深度センサーを使ってトレーニングされたポリシー(従来のベースライン)、同じ生成されたテクスチャ付きメッシュでRGBを使ったポリシー、合成のテクスチャ付きオフィスメッシュでRGBを使ったポリシー、そして実際の現場の3DGS再構築でRGBを使ったポリシーの4つです。

以下のグラフは全4ポリシーにわたる3つのシミュレーション指標を示しています。成功率・タイムアウト率(120秒後)・転倒率です。各ポリシーは1,024回のロールアウトで評価され、スポーン姿勢と目標姿勢を各条件で統一することで、センサーのモダリティとトレーニング環境の影響のみを比較できるようにしています。

ナビゲーションベンチマーク — シーン比較
再構築手法

Flexionオフィス

Niantic Spatialオフィス

成功 タイムアウト 転倒

全シーンにわたって、3DGS再構築でトレーニングされたRGBは、従来の深度ベースのベースラインに匹敵または上回る唯一のRGBアプローチです。よりシンプルなFlexionオフィスで97.8% 対 93.8%、よりハードなNiantic Spatialオフィスでも75.0% 対 70.9%。合成オフィスや生成メッシュを使った他のRGB環境は両シーンで深度に届かず、シーンが難しくなるほどその差は広がります。シミュレーション上でRGBポリシーが深度と同水準の信頼性に達するには、3D再構築が不可欠です。

RGBがステレオ深度の典型的な失敗ケースに対応

今回の実験では、深度ストリームはニューラルモードのZED Xカメラから得られています。高性能なセンサーですが、ステレオ深度では依然として困難なシナリオや、深度変換の段階で重要な情報が失われるケースがあります。

以下に3つの代表的なケースを示します。

非幾何学的な手がかり

Hazards defined more by semantics than geometry. In this example, a blue mat is obvious in RGB but barely registers on the depth stream, even though its raised edge is enough to trip a non-perceptive locomotion policy.

細い構造物

Tripods, railings, and cables are especially challenging for depth-based methods, which can miss them entirely or blur their edges. This issue can be mitigated, but doing so typically requires significant scene engineering and a realistic model of depth noise.

透明な面

Glass doors and windows, where depth sensors routinely struggle.

ここで示したシーン—ブルーのマット・三脚・ガラスの仕切り—はいずれもシーン3D再構築時には存在していませんでした。つまりポリシーは、これらをトレーニング中に見たことがありません。

では、なぜ3D再構築でトレーニングされたRGBポリシーが、それでも現実世界でこれらに対処できるのでしょうか。

シミュレーショントレーニング中、ポリシーは意味的に関連するオブジェクトに繰り返し衝突し、それらとの接触を失敗として関連付けることを学習しました。この特定のガラスの仕切りは見たことがありませんでしたが、3D再構築には窓が含まれていました。シミュレーション内でそれら透明な面に対して失敗することで、ポリシーはフレーム付きのガラス状の面を——初めて遭遇するものでも——障害物として認識することを学んだのです。

ただし、これは同時にこのアプローチの限界でもあります。RGBは万能ではありません。ポリシーはトレーニング中に見たものと意味的に類似するオブジェクトには汎化しますが、経験から遠く離れたものへの汎化は弱くなります。

だからこそ長期的には、大規模な並列知覚事前学習と再構築内でのファインチューニングを組み合わせることが、広い汎化性とデプロイサイトへの特化を両立させる道筋となります。

ループを閉じる——そして次の展望

ポリシーをデプロイする手段のない完璧な3D再構築は、説得力のあるデモに過ぎません。学習のための忠実な世界のない優れたsim2realのレシピは、学習できる情報が限られています。real2simとsim2realが合わさることで、現実の場所がトレーニングの場となり、トレーニングされたポリシーがその環境で動作するロボットへと還元されます。

今後の展開:

  • データ収集のスケーリング:iPhoneや魚眼カメラのような市販ハードウェアによるキャプチャにも拡張することで、現実世界の環境から大規模なデータセットを構築し、将来のロボットポリシーのためのより広いトレーニングの場を作ることが可能になります。

  • セマンティックなシーン理解: 3D再構築内のサーフェスやオブジェクトにオープンボキャブラリーなラベルを付与することで、デジタルツインを単に可視化するだけでなくクエリ可能にします。

  • シーン変換: キャプチャされたシーンのコントロールされたバリエーションを生成すること——照明や時刻などの外観変化、ドアの開閉や家具の移動などの状態変化——により、ポリシーをより広い条件とインタラクションに対してトレーニングできるようになります。

  • シミュレーション内でのエンドツーエンド評価: D再構築された環境内でのローカルナビゲーションから、フルタスクパフォーマンスへと評価を拡張します。FlexionのReflect v1.0 は、ナビゲーション・インタラクション・計画・リカバリを一つのシステムに統合した、長期的な自律性に向けたより広い方向性の具体例です。

  • VLMとエージェントトレーニング: ナビゲーションを超えて、同じ3D再構築されたシーンに根ざした言語条件付き行動へと発展させます。

商業的により広く影響を与えることになります。新しい環境へのロボットポリシーのデプロイには従来、数ヶ月にわたる現場での適応作業が必要でした。real2simとsim2realを組み合わせることで、そのタイムラインを数日に短縮し、開発が速く実運用でより堅牢なポリシーのデプロイが可能になります。複数の工場や施設にわたって自律ロボットをスケールしようとするオペレーターにとって、このパイプラインは明確で再現性の高い道筋を提供します。

About Niantic Spatial

Niantic Spatialは、フィジカルAIのためのリアルワールドモデルを構築しています。ロボット・AIエージェント・人々が物理空間を正確かつ共通に理解できるようにすることを目指しています。3D再構築技術はあらゆる標準的なカメラから幾何学的精度と精細なディテールで環境をキャプチャし、Visual Positioning Systemは世界中のほぼあらゆる場所で正確な位置推定を提供します。詳細はnianticspatial.comをご覧ください。

Flexionについて

Flexionはヒューマノイドロボットの自律スタックを構築しています。コマンドからコントロール、操作から歩行まで、シミュレーションと強化学習を活用し、最小限の人的介入でさまざまな環境とハードウェアプラットフォームに汎化・スケールできる設計です。詳細はflexion.aiをご覧ください。

共有: