オルタナティブ・ブログ > 経営者が読むNVIDIAのフィジカルAI / ADAS業界日報 by 今泉大輔 >

20年以上断続的にこのブログを書き継いできたインフラコモンズ代表の今泉大輔です。NVIDIAのフィジカルAIの世界が日本の上場企業多数に時価総額増大の事業機会を1つだけではなく複数与えることを確信してこの名前にしました。ネタは無限にあります。何卒よろしくお願い申し上げます。

高市政権は中国に負けないためにフィジカルAI「テレオペレーション」にどれだけの予算を付けるべきか?

»

日本は中国のフィジカルAI/ヒューマノイドに負けています。フィジカルAIの個々の技術分野については、猛烈な勢いでキャッチアップしていることがわかりましたが( 日本のフィジカルAIの実装レベルが数段階上がった!フィジカルAIセミナーのセッションをシミュレーションして見えた技術のディテール【勉強資料】 )「投資の規模」が必要な分野では、圧倒的に後塵を拝しています。

一昨日見た中国系報道チャンネルCGTVの西側向けプロパガンダYouTube番組では、AgiBotの研究開発とテレオペレーションによるデータ収集を細かく報じていました。同社のテレオペレーションの規模感と、日本で最も進んでいるTelexistenceのテレオペレーションの現状とを比較して、日本政府が高市政権17の戦略分野のフィジカルAIに割り当てた10兆円あまりを、どのように、戦略的に日本の「テレオペレーション」に割り当てるべきか?を、現在私が理解している中では最高の粒度で論じることができるGrokに論じさせました。引用動画真下のAgiBotテレオペレーションの要約はNotebookLMによるもの。

AIのことはAIで分析しないとラチが明かない時代に入っています。

関連レポート:

モノづくりとしてのAgibotフィジカルAIを中国語資料を中心に調査した報告書【産業調査】

動画内で説明されているAgiBot(智元機器人)の施設では、テレオペレーション(遠隔操作)で得られたデータは以下のようなステップで処理・活用されています。
  1. マルチモーダルデータとしての収集 テレオペレーターがVRヘッドセットやジョイスティックを装着してロボットを遠隔操作し、タスク(Tシャツの折りたたみや片付けなど)を実行します。この際、カメラの視覚データ、力覚センサー(force sensors)のデータ、および各アクチュエータ(モーター)の制御信号など、すべてのセンサー入力と制御データがセットで記録されます。
  2. クラウドへのアップロードとアノテーション・アセスメント(品質検証) 収集されたデータはクラウド/データセンターへアップロードされます。その後、人間のアノテーターがデータの検証(Data qualification)を行い、以下の品質項目をチェックします:
    • センサーデータのフレーム落ち(コマ落ち)がないか
    • カメラの視野角(field of view)が適切か
    • モーターおよびアクチュエータの制御信号が正しく記録されているか
  3. 具現化AI基盤モデル(Embodied Intelligence Foundation Model)の学習 品質検証を通過した大量のデータを用いて、データセンターで**「具現化AI基盤モデル」**のトレーニングが行われます。AIにロボットの身体を与えることで、物理世界の試行錯誤や経験から学習させます。
  4. フューショット能力による未知タスクへの適応と自律動作 強力な基盤モデルが構築されると、**「フューショット学習機能(Few-shot capability)」**が備わります。これにより、未経験の新しい環境や初めてのタスクであっても、ほんのわずかな追加データのみで迅速に適応できるようになります。最終的にこのモデルをロボットに適用することで、テレオペレーションなしで多種多様な作業を自律的に実行できるようになります。

政府と中国、フィジカルAI予算論争その4.jpg

テレオペレーションは、ロボットに「現場の身体経験」を渡すための生産工程

文章や画像のAIは、インターネット上にすでに存在するデータを学べます。フィジカルAIは違います。ロボットが棚からペットボトルを取り、箱を向きを揃えて置き、人が横をすれ違っても作業を続ける、という経験は、ウェブをクロールしても出てきません。誰かが現実の身体を動かした記録を、センサーと制御信号のセットで残す必要があります。

その最も速い集め方が、テレオペレーション(遠隔操作)です。人がVRや操作装置でロボットを動かし、同じ時間軸で次のデータを残します。

  • カメラの映像(どの棚を見て、何を掴もうとしたか)
  • 関節や手先の動き(どこまで腕を伸ばし、どの角度で閉じたか)
  • 力や触覚(どのくらいの強さで握り、滑り始めたか)
  • 操作そのものの信号(成功したのか、途中で持ち直したのか)

これは「人が代わりに働いたログ」ではなく、ロボットが後から自分で同じことをするための教科書です。自動運転でいう走行データに近く、工場の改善でいう標準作業の動画より、はるかに機械が読める形になっている必要があります。

遠隔操作が要る理由は、自律がまだ未熟だから、だけではありません。未知の商品、崩れた陳列、濡れた床、人が急に手を出す、といった現場は、最初から完璧なプログラムを書けません。人が一度うまくやって見せ、その成功と失敗の両方をモデルに食わせる方が、事業として早く回り始めます。遠隔操作は「完成までのつなぎ」ではなく、データを生み続ける生産ラインです。

なぜ「少し」では足りず、規模が要るのか

一回うまくいったデモと、店や倉庫で毎日使える知能は別物です。規模が要る理由は、次の四つに整理できます。

第一に、現場は毎回違います。同じ「飲料を補充する」でも、瓶の形、棚の空き、照明、床の段差、隣の作業者の位置が変わります。数十本の成功動画では、見たことのある棚でしか動きません。数百、数千時間になると、「初めての棚でも、だいたいこう掴めばよい」という共通の勘が生まれます。これを業界では汎化と呼びます。

第二に、失敗とやり直しが教材です。先進的な収集現場では、人がわざと邪魔をしたり、持ち損ねから回復したりするデータも残します。完璧な見本だけを集めると、ロボットは一度滑った瞬間に止まります。事業で使えるロボットは、滑ったあとに持ち直せるロボットです。

第三に、少量データでは基盤モデルになりません。特定の棚、特定の商品だけを覚えるモデルは、その店の自動化には使えます。しかし別の顧客、別の季節商品、別の倉庫に横展開するには、最初から多様なタスクで事前学習した土台が要ります。土台があれば、新しい現場ではわずかな追加データで適応できます。これがフューショットです。土台がなければ、顧客のたびに最初から遠隔操作で教え直すことになり、人件費が下がりません。

第四に、品質を見る人手が規模についてきます。映像が欠けている、手元が画面の外に出ている、モーターの記録が飛んでいる、といったデータは学習を悪化させます。大量に集めるほど、集めたあとに人が見て落とす工程が必要です。データ量と同時に、検証の工程能力も事業資産になります。

シミュレーションは補完には有効です。実データの数倍から数十倍に増やせることがあります。ただし、力の入り具合、商品の変形、狭いバックヤードでの体の干渉は、実機で一度も触っていないと再現がずれます。実データの工場が先にあり、シミュレーションはその増幅器、という順序です。

LIVE SEMINAR
2026年 11/17 (火) 13:00-16:00
ライブ配信対応
後日録画視聴可
【日刊工業新聞社 主催セミナー】

自動車工場における「フィジカルAI・ヒューマノイド」実装技術と生技変革 ~BMW・ベンツ・中国ジーカーの制御・Sim-to-Real徹底解剖~

米・独・中のメガ自動車ファクトリーで急速に進む人型ロボット・AMR群知能の実装最前線。VLA基盤モデルの推論サイクル、Sim-to-Realギャップ補正、5G MEC低遅延協調制御まで、生技部門が直面する変革の急所を体系的に解剖します。

講義プログラム概要 米・独・中の先行実装事例を徹底解剖
  • 【第1部】BMWスパータンバーグ工場 × Figure AI(米国)
    「Figure 02/03」の関節諸元・高自由度ハンド機構 / VLA基盤モデル推論 / Sim-to-Real合成データ学習 / 車体溶接治具への5mm精度板金配置
  • 【第2部】メルセデス・ベンツ・ベルリン工場 × Apptronik(ドイツ)
    NASA系譜の「Apollo」設計思想・可搬25kg / 既存工場(Brownfield)での二足歩行安定化アルゴリズム / 部品キッティング・トード搬送における把持制御
  • 【第3部】BMWディンゴルフィング/ライプツィヒ工場(ドイツ)
    内製スマート物流STRとOpenUSD規格 / 数百台規模のAMR群管理AIとデッドロック回避 / 混流ラインSLAM同期・インラインAIビジョン検査基盤
  • 【第4部】極氪(Zeekr)寧波5Gスマート工場 × UBTECH / 華研(中国)
    「Walker S1」& 華研智造4腕協調ロボット / オンプレMEC・プライベート5Gスライシング / 異種ロボット群知能 / ワイヤーハーネス等の柔軟材組付け制御

主催:日刊工業新聞社

先進事例:中国AgiBotは「データ工場」を先に作った

智元機器人(AgiBot)は、遠隔操作を研究テーマではなく生産設備として扱っています。公開されているAgiBot Worldは、100万本超の軌道、総時間約2,976時間、217タスク、106シーンです。実験室の机の上ではなく、商業空間や家庭に近い環境を実物大で再現し、双腕・移動・器用な手で集めています。映像だけでなく、関節状態や視覚触覚まで同じ時刻で記録し、人が品質を確認してから学習に回します。

その先にあるのが、具現化AIの基盤モデルです。同社はGO-1に続きGO-2を出し、数万時間規模の相互作用データと、現場に出したロボットからデータを戻して再学習する循環を掲げています。収集施設では、オペレーターがVRなどで折り畳みや片付けを繰り返し、クラウドへ上げ、フレーム落ちや視野や制御信号を人が確認し、通過したデータだけがモデル学習に入ります。モデルが強くなると、未経験のタスクでも少量の追加データで適応し、最終的には遠隔操作なしで動く、という順です。

ここで見るべきはロボットの見た目ではありません。100台規模の機体、専任オペレーター、品質検査、学習用計算、現場への再配備が一つの工場になっている点です。データがモデルを良くし、モデルが現場の成功率を上げ、現場が次のデータを返す。この循環の速度が、競争の単位になっています。

日本側:Telexistenceは「店で稼ぐデータ」、他は工場を作り始めた段階

同じ粒度で並べると、日本で最も形になっているのはTelexistence(テレイグジスタンス)です。同社はコンビニの飲料陳列ロボット「TX Ghost」を遠隔操作と自律の組み合わせで実店舗に入れ、ファミリーマートに加えセブン-イレブンでも試験運用を広げています。売れるサービスの中で操作データが溜まる点が、研究室のデータと違います。2026年1月からは、多関節ロボットで顧客指定の動作データを生成し、必要ならクレンジングもする「モーションデータ工場」を事業化するとしています。データそのものを電力や通信のような供給財にする、という宣言です。言語モデル起点と、世界の動き方を学ぶ動画モデル起点の両方で基盤モデルを試し、NVIDIAの世界モデルも組み合わせています。ハード、遠隔操作、現場オペレーション、データ、学習を一社で持つ点は、AgiBotの産業構造に一番近いです。

一方で、公開されている軌道数はAgiBotの100万本・約3,000時間には届いていません。強みは「すでに店で回っていること」であり、汎用データセットの物量ではまだ追う側です。

データ工場の見た目に近いのは、次の動きです。山善、ツムラ、レオン自動機などが組むJ-HRTIは、2026年7月に千葉湾岸で約1,400平方メートルの収集センターを稼働させ、AgiBotの機体を50台、オペレーターとアノテーター約100人を置く計画です。中国側の大量データを土台に、日本の梱包・搬送データを上乗せし、データの権利は分ける、としています。APTOは豊洲に実機データのラボを開き、収集、品質管理、学習、評価を循環させるデータファクトリーを事業にしています。家事データではMWが収集マシン約50台、年間5万時間、最終2.5ペタバイトという計画を出しています。ヒューマノイドのアトムは、将来200台・30万時間規模を検証対象に置いています。

政策側の受け皿はNoetraです。ソニーグループ、ソフトバンク、NEC、ホンダを中核に、ファナックや安川電機などが出資し、産業技術総合研究所とともに、2026年度から2030年度のNEDO事業「AIロボット・フィジカルAIを見据えたマルチモーダル基盤モデル開発」の実施先になっています。これはモデルと産業データの循環を国産で持つ枠組みであり、それ自体は重要です。ただし遠隔操作の収集工場そのものではありません。Preferred Networksは小売とフィジカルAIの実装、Mujinは物流の自律、FastLabelはアノテーションとデータ拡張、という役割分担です。Highlandersはヒューマノイドの開発・データ基盤・量産を一体で掲げる段階です。

対比すると、AgiBotは「集める工場」と「モデル」と「機体量産」を同時に持っています。日本は、店でデータを生むTelexistence、工場を建て始めたAPTOやJ-HRTI、モデルを束ねるNoetra、現場実装のMujinや大手、に分かれています。どれか一つが欠けても循環は遅くなります。

経営者にとっての判断

テレオペの予算は、研究開発費ではなく生産能力への投資です。見るべき指標は、デモの成功率ではなく、月に何時間の合格データが出るか、そのデータは自社に残るか、新しい顧客に何時間の追加教示で展開できるか、です。

自社だけのデータで閉じると、横展開のたびに人が教え直す費用が残ります。逆に、データもモデルも外部に出し切ると、現場の差が競争力になりません。現実的な線は、共通の土台は共有し、力加減や商品の扱いなど顧客固有の部分は自社に残す、です。J-HRTIが権利を分けると言っているのは、この線です。

遠隔操作を「人件費の高い過渡期」と切ると、データが貯まる前に自律を急ぎ、現場で止まります。最初の数年は、遠隔の人件費をデータの製造原価として持つ方が、後の展開コストは下がります。

経産省への助言:どの事業に、どの規模の公的資金を置くべきか

高市政権の戦略17分野では、AI・半導体の中にフィジカルAIが置かれ、2040年度までに官民で10.5兆円という数字が示されています。政府は2040年に60兆円規模とされるAIロボット市場で世界シェア3割超、20兆円の取り込みを目標にしています。呼び水としての国費は、この10.5兆円の一部です。現在動いている大型事業は、Noetraと産総研による国産マルチモーダル基盤モデルが中心です。方向は正しいのですが、このままでは「モデルの器」に対して「中身の実機データ」が不足します。

補助金と委託を優先すべきなのは、ロボットを作る会社一般ではありません。次の三つを、一つの採択条件でつなぐべきです。

第一に、実環境で遠隔操作データを継続生産できる事業者です。Telexistenceのように、コンビニや物流で既にオペレーションを持ち、モーションデータ工場として外販もする会社が該当します。条件は、機体の展示ではなく、年間の合格データ時間、シーン数、失敗回復データの比率、日本国内へのデータ保管を数値で出すことです。

第二に、特定産業の収集センターを運営するコンソーシアムです。J-HRTI型の梱包・搬送、APTO型のデータ品質工場、建設や介護のように公共調達と結びつく現場です。ここで海外機体を使っても構いません。ただし学習済み重みと生データの利用権を契約で分け、日本側が追加学習できる状態を採択要件にしてください。機体の国産化と、データの主権は、別の予算で扱うべきです。

第三に、そのデータを実際に食う国産モデル事業です。Noetraの基盤モデルは継続が必要ですが、映像やセンサーの一般的なマルチモーダルだけではロボットは動きません。ロボットの関節と力と結果がそろった軌道データを、年間で最低でもAgiBot公開セットに匹敵する数千時間、できれば数万時間、国内事業者から買って学習する義務を課すべきです。モデル予算の一部を、データ購入としてデータ工場に流す設計です。

金額の置き方は、2040年までの10.5兆円を薄く配るのではなく、最初の5年でデータ生産能力に集中させるのが不可欠です。AgiBot級の1拠点は、機体数十から100台、オペレーターと検証人員100人規模、学習用計算がセットで、単年度数十億円、立ち上げを含めると100億円前後が一つの単位になります。日本が小売、物流、製造、建設・インフラの4領域で、それぞれ1から2拠点を5年間維持し、モデル側がそれを買うとすると、データ基盤だけで公的支出は5年累計で1,500億から3,000億円が下限です。このうち半分を委託・補助、半分をデータ購入契約にすると、民間の設備投資を引き出しやすくなります。10.5兆円の官民目標に対しては数パーセントであり、ここを削ると残りがモデルと通信と半導体だけになって、身体を動かすデータが中国と米国の現場に依存します。

つけてはいけないのは、単発の実証、数台の試作、成果が動画だけの補助です。継続条件は、年次で「合格データ時間」「他社が追加学習に使えた件数」「遠隔操作比率の低下」の三つにすべきです。遠隔比率が下がることは、データ工場が機能した証拠です。下がらないうちに補助を切ると、またデモに戻ります。

日本の強みは、産業用ロボットの供給と、コンビニや工場や建設の現場密度です。足りないのは、その現場を遠隔操作の生産ラインに変える設備投資です。予算はモデルの開発者だけでなく、データを毎日製造する事業者に、時間単位で支払われる形が、今の格差を縮める最短です。

Comment(0)