日本のフィジカルAIのレベルが数段階上がった!フィジカルAIセミナーのセッションをシミュレーションして見えた技術のディテール【勉強資料】
AIの先端動向はAIで分析しないと理解できない。そういう時代に入りました。フィジカルAIも同様。日本も、世界も、動きはAIを使わないと全く理解できない領域に入っています。日進月歩で進化する状況を、自分がわかる言語で翻訳してくれるAIが不可欠です。またそうしたユースケースを自分のモノにする必要があります。
10月15日にCoreWeave・Weights & Biases 主催、NVIDIA協力で開催される、日本の最先端でフィジカルAIを研究・実装するエンジニア数名が登壇するセミナー「Physical AI Day」のセッション内容が刺激的です。
東京(東京ガーデンテラス紀尾井町 紀尾井カンファレンス)
私はこの日セミナーが入っており、「AIデータセンター入門」として2時間半話さなければいけません。
【宣伝】オンラインセミナー:2026年10月15日 これから携わる方のための【AIデータセンター入門】-生成AIを支える「巨大な設備産業」の仕組み・業界地図・日本企業への影響-
ということで、日本の精鋭によるフィジカルAIセミナーの内容を、ある最先端のAIの力を借りて、公開資料ベースで事前シミュレーションして見ました。やってみて驚きました。記述内容があまりに高解像度です。(フィジカルAIについて、あまりに知りぬいているこのAIは、なんでしょうか?答えはGrokです。Geminiを超えました。)日本のフィジカルAI実装の最先端が、その技術ディテールがぎっしり詰まっています。日本のフィジカルAIがここまで来ているんだ?!という素朴な驚きがあります。
これらのタームを拾って、フィジカルAIの学習深度が深い、そして広いAIを伴走者として深掘り勉強するなら、素地がすでにできているエンジニアなら3か月でキャッチアップできると思います。実機とNVIDIAスタックとAWSスタックを手元に置いて勉強することが不可欠です。エンジニアの方々の勉強用の資料として共有します。
また、前段に、経営者目線のテイクアウェイを置きました。
【経営者向けテイクアウェイ】
日本の最先端を走るエンジニア数名による各セッションの事前シミュレーションから見えてきたポイントです。(シミュレーションは公開資料による) 大事なのは、実装の細部より 「誰がどの層を取り、何がまだ実証ではなく目標か」 です。経営層向けのテイクアウェイとしてまとめます。
1. フィジカルAIはモデル名ではなく循環である
見る → 判断する → 動かす → その結果をまた学習する、が本体です。VLAやWAMは部品です。会議で「どのモデルが強いか」から入ると、現場ではデータ・機体・評価条件の話に負けます。問うべきは データ→学習→実機→再学習が回っているか です。
2. 成功率はモデルだけでは決まらない
Algomaticの公式要旨が一番正直です。機構の精度、遠隔操作、アノテーション、学習のどこか一箇所が細いと、モデルを大きくしても落ちます。戦略上は「AI投資」と「手・アーム・収集オペレーション投資」を別科目にしないことです。
3. いま詰まっている作業は、単腕+平行グリッパの外側にある
持ち替え、柔らかい物、力加減、靴の状態確認、ケーブルの張り。ここが2026年の実務テーマです。研究用OpenArmと工場のFANUCは機体が違っても、接触と両手 で同じ壁に当たっています。
4. 学習の単位が「一歩」から「一連の動き」に移っている
W&Bが言う trajectory-level RL(GRPO)は技術用語ですが、意味は単純です。双腕のどちらが悪いか、軌道の途中の接触は、瞬間の損失では見えない。実験も損失曲線だけでは再現できません。映像と軌跡が残っていない実証は、再現不能なPoCです。
5. 日本勢の役割分担が、この1日の並びで見える
|
層 |
誰 |
取りにいっているもの |
|
設計図・シミュ・基盤モデル |
NVIDIA |
Isaac / Cosmos / GR00T |
|
実験の再現 |
W&B+計算基盤 |
軌道・映像・指標の一体管理 |
|
手 |
Algomatic |
多指と収集の一周 |
|
研究用腕にモデルを載せる |
ABEJA |
OpenArm+VLAOps |
|
自社オペの汚いタスク |
メルカリ |
越境倉庫の靴検品 |
|
既設100万台を開く |
ファナック |
ROS 2 / Python / 1ms指令 |
|
学習と合成データの計算 |
AWS |
バースト計算と循環基盤 |
「日本にフィジカルAIがあるか」ではなく、どの層を自社で持ち、どこを外部パーティに頼るか が戦略質問です。
6. 工場側の本丸は「モデル開発」ではなく「開くこと」
ファナックの宣言は、自前VLAを世界一にすることではありません。累計100万台超の産業ロボットを、外のAIが1ミリ秒で指令できる口にする、です。既存のティーチング文化とPython/ROS 2の共存が、導入の本当の摩擦です。溶接エージェントの「ゼロ教示」は製品メッセージであり、歩留まりはまだ公開されていません。(今泉注:これまで自社に閉じられていた産業向け技術を、日進月歩のフィジカルAIエコシステムの中で動いているオープンイノベーション・モメンタムに載せないと発展スピードが加速しない...ということを、実例で教えてくれるファナックの姿勢には深い含意がある。一言で言えば、日本企業がこれまで拠ってきた【自前主義】を否定しないと、AIの時代は生き残っていけない。)
7. クラウド対エッジは対立ではない
制御のミリ秒は現場、学習・シミュレーション・データ拡張はクラウド。AWSの主張は「全部クラウド」ではなく、オンプレ固定では学習と何百通りものシミュレーションが回らない、です。遅延の話と計算規模の話を混ぜると判断を誤ります。(今泉注:今回の分析でAWSがフィジカルAI開発に不可欠であることがよくわかりました。)(ちなみにAmazonには、フルフィルメントセンターで総計100万台のロボットを秒で動かす巨大なフィジカルAI実績があるので、社内にフィジカルAIのノウハウが世界トップレベルで集積されており、それがAWSスタックを現場で使えるレベル感で提供できる素地になっていると思われる。以下の記事を参照)
参考記事:
なぜAmazonの3000台の倉庫物流ロボットは同時に動いても衝突しないのか? 武庫川フルフィルメントセンター「大規模AMRオーケストレーション」と「産業用デジタルツイン」の技術的全体像【産業調査】
8. 事業動機が先にある案件と、技術が先にある案件を分ける
メルカリは越境で検品が増えるからロボットを入れる。KPIは2028年に倉庫20%、年2億円削減、と先に出ています。ABEJAは検証環境の持ち替え成功とVLAOps。Algomaticは手のプラットフォームと50億円。動機が倉庫コストなのか、基盤モデル事業なのか、ハンド販売なのかで、同じ「VLA」でも投資判断が変わります。
9. 公開数字の大半は目標か自己申告である
検証環境下の成功、GENIAC採択、プログラム成果の成功率、2028年目標、12月末出荷開始。これらは方向性の証拠であって、現場歩留まりの証拠ではありません。アナリストが資料に書くときは、実証段階/目標/製品化発表 を必ず分けることです。
10. 国家プロジェクトは「計算とデータの補助金」として効いている
GENIAC(メルカリの出品・検品、ほかロボット基盤モデル13件)、NEDOの視触覚データ(ABEJA・ファナックら)、AWSプログラム51社。技術の優勝劣敗というより、実機データと大規模学習に公的・クラウド資源を流す装置 です。採択そのものを実力の証明と読まないことです。
11. 覚える語は少なくてよい
会議で落ちない単語だけ持てば足ります。
- VLA:見て、言われて、動くモデル
- WAM:学習系のもう一方(従来プログラム制御と対で出る)
- Sim2Real:シミュでできたことが実機でできるか
- テレオペ/デモ:人が動かして学習データを取る
- VLAOps:一度動かして終わりにしない運用
- Advantage collapse:軌道ごとの良し悪しが潰れて学習が止まる現象、程度の理解でよい
モデル版数(π0.5、GR00T、SmolVLA)は、その場の資料を見ればよく、暗記対象ではありません。
12. このイベント自体の戦略的な読み
建前はツール説明会ではなく、失敗とボトルネックの共有です。(今泉注:AIもフィジカルAIも失敗から学習する。学習して前に進むためには失敗したデータこそが貴重。より多く失敗してより多く失敗データを実機に還元できた企業が勝つ。AIデータフライホイールを回すということ。)だから公式要旨が「試行錯誤」「困難」「限界が3つ」「クラウドが必要な理由」と、成功物語を避けています。アナリストとして聞くべきはデモの華麗さより、どこを公開し、どこを目標のまま残したか です。短くすると、記憶に残すのはこの一文で足ります。フィジカルAIの競争はモデル名ではなく、接触作業を回すデータと機体と評価の循環を、誰が自社オペの中に埋められるかである。
【フィジカルAIセミナー:各セッションの事前シミュレーション】
初回3本は、当時の詳細度に戻すため公開情報を再確認します。# Physical AI Day(2026年10月15日)公開資料による主セッション整理
CoreWeave・Weights & Biases主催、NVIDIA協力の Physical AI Day(2026年10月15日、13:00-18:30、東京ガーデンテラス紀尾井町 紀尾井カンファレンス)について、公式要旨と、各登壇者・所属組織がイベント前に出している公開情報だけを、端折らず一本にまとめたものです。当日スライドや録画はありません。
公式の趣旨は次です。Physical AIの開発には、モデル学習、シミュレーション、データ収集、評価、実環境への適用など、さまざまな難しさがある。一方で「何がうまくいかなかったのか」「どこで苦労したのか」「実際にやってみて初めて分かったこと」はブログや事例記事になりにくく、同じ課題を各現場が別々に試行錯誤している。このイベントは成功だけでなく、難しかったことや失敗から得た学びまで共有する場にする。後半はNVIDIA、AWS、Weights & Biasesのツール説明もあるが、提供者から一方的に話すのではなく、開発者の課題を提供側も学ぶ、という建て付けです。
以下は予習用です。議事録の代わりにはなりません。
NVIDIA
ソリューションアーキテクチャ&エンジニアリング
ロボティクス デベロッパーリレーションズ シニアマネージャー
荒井 謙 氏
フィジカルAIの実用化にむけたアプローチと展望(13:05-13:25)
公式要旨
フィジカルAIの実用化には、VLAやWAMなどのロボット学習に加え、従来のプログラマブルなモデル化手法との組み合わせなど全体を見据えた設計が求められます。本講演では、データパイプラインの設計、学習データの管理・品質確保、ベンチマーキングなど、開発を支える課題を整理し、学習・評価・実機展開をつなぐ実践的なアプローチと今後の展望を紹介します。
公開情報から読める位置づけ
冒頭20分です。個別タスクの成功談ではなく、実装スタック全体の見取り図です。要旨が先に名前を出しているのは次の2系統です。
- VLA(Vision-Language-Action)
視覚と言語から行動を出す学習モデル。後続のABEJA、メルカリ、AWSがそのまま使う語です。 - WAM
要旨にVLAと並べて出ています。ロボット学習側のモデル族のもう一方で、従来の「全部プログラムで書く」側と対になる学習系として置かれています。
そのうえで要旨が強調するのは、学習モデルだけで実用化しない、という点です。従来のプログラマブルなモデル化(教示、軌道計画、力制御、安全PLC、従来ビジョン)と学習をどう組み合わせるかが、全体設計の本体です。
要旨が列挙する開発課題
公開文面から分解できる層は4つです。
- データパイプラインの設計
誰が、どのカメラで、どの周波数で、どのアクション空間にデモを落とすか。収集手段(リーダー・フォロワー、VR、UMI、実作業の変換)が後続セッションで分岐します。 - 学習データの管理・品質確保
量だけでなく、失敗軌道、接触、視点ずれ、力覚の欠落が品質問題になる。W&B講演の「映像とトレースを同じrunに残す」話と直結します。 - ベンチマーキング
「モデルAがモデルBより良い」は、同じ機体・同じ照明・同じカメラでなければ比較になりません。OpenArm側が評価セルを標準化している理由でもあります。 - 学習・評価・実機展開をつなぐ
Isaac(シミュレーション/学習)、Cosmos(世界モデル)、GR00T(ロボット基盤モデル)がNVIDIA公開スタックです。シミュレータで回したポリシーを、産業ロボットやヒューマノイド型アームへ載せるときの Sim2Real が、実用化の境目です。
後続への渡し方
この枠で名前が揃うものは、あとのセッションで実体を持ちます。
- VLA → ABEJAの双腕、メルカリの靴検品、AWSの学習基盤
- プログラマブル制御との共存 → ファナックのティーチング言語とROS 2/Python
- データ品質と評価 → W&Bの実験管理、Algomaticの収集パイプライン
- シミュレーション → ファナックのROBOGUIDE×Isaac Sim、AWSのG6e/G7e
20分なので、個別論文の再現ではなく、パイプラインの切れ目の列挙になると見てよいです。当日どの製品世代(Isaac / Cosmos / GR00Tの版)を出すかは、公開要旨にはありません。
CoreWeave・Weights & Biases
Senior Account Solutions Architect
山本 祐也 氏
フィジカルAIにおける Trajectory-level 強化学習と実験管理(13:25-13:45)
公式要旨
フィジカルAIにおけるVLA(Vision-Language-Action)モデルの強化学習では、環境との相互作用を伴う複雑な軌跡の評価と管理が不可欠です。本講演では、クリティック不要で軌跡単位の更新を行うGRPOの適用法(行動トークン型・フローマッチング型)を整理し、数値指標と動画・トレースを統合した実験管理手法を紹介します。実践から見えた利点やAdvantage collapse等の課題も共有します。
公開情報から読める技術的な中身
模倣学習の先に強化学習を置くとき、ステップ(トークン、制御周期)単位ではなく 軌道(trajectory)単位 で最適化する、という立場です。
GRPO(Group Relative Policy Optimization) は、価値関数(クリティック)を別モデルとして持たず、同じ条件から出した複数軌道の相対的な良さでadvantageを取る手法です。LLMの推論学習(DeepSeek-R1系)で広まった型を、VLAの行動系列に持ち込む、という読みです。
要旨が明示する2変種:
- 行動トークン型
行動を離散/トークン列として出し、グループ内の相対報酬で更新する。 - フローマッチング型
連続行動をflow matchingで生成するVLA(π0系など)向け。同じGRPOの型を、生成過程の違いに合わせて適用する。
Advantage collapse も要旨に名前があります。グループ内の報酬差が潰れると、相対advantageがほぼゼロになり、更新が止まる(あるいはノイズだけになる)現象です。軌道が全部成功する、全部失敗する、長さだけ違う、接触の功罪が軌道末尾にしか出ない、といったフィジカルAI特有の報酬の疎さが、この崩壊を起こしやすい、というのが公開されている問題意識です。
軌跡単位にする理由も、後続の現場セッションから逆算できます。双腕の持ち替えは「どの瞬間が悪いか」が分かりにくい。靴検品の力加減はステップ損失に出ない。ケーブル配線の張りも軌道全体の評価です。ステップ単位PPOの価値関数をロボットで安定学習するのは高く、クリティック不要のGRPOが実務候補になる、という筋です。
実験管理側
W&B側の主張は、損失曲線だけではフィジカルAIの実験が再現できない、です。同じrunに残すべきものとして要旨が挙げるのは次です。
- 数値指標
- 動画(ロールアウト)
- トレース(軌跡、センサ、指令)
CoreWeaveは計算基盤、W&Bは実験の再現装置、という役割分担です。軌道単位RLはロールアウト本数が増えるので、計算とログが同時に膨れます。この2社が同じ枠にいる理由です。
利点と課題の両方を話す、と要旨が書いている点は、イベント趣旨(失敗も共有する)と一致しています。使うVLAの具体名、報酬設計、グループサイズは未公表です。
株式会社Algomatic Dynamics
代表取締役CEO
南里 勇気 氏
多指ハンド開発の困難(13:45-14:10)
公式要旨
多指ハンドのタスク成功率は、モデルだけでは決まりません。ハンドの機構と精度、遠隔操作によるデータ収集、アノテーション、学習。この一気通貫のパイプラインのどこかがボトルネックになるだけで、成功率は下がります。オープンソースのハンドを改造し、収集から学習までを自前で一周させた経験から、各段階で実際に何が効き、何がボトルネックになったのかを紹介します。
登壇者と会社の公開情報
南里氏はAlgomatic Dynamics代表取締役CEO。慶應出身、東大田中研の学術専門職員でもあります。生成AI事業のAlgomaticでCTOを務めたあと、2026年4月27日にロボティクス/フィジカルAI特化のAlgomatic Dynamicsを設立しました。ミッションは「Bringing smoothness to every robot.(すべてのロボットに滑らかさを)」。速さでも強さでも賢さでもなく、滑らかさ、とnoteで定義しています。
2026年9月9日、DMM.comを引受先とする50億円の資金調達を発表。2026年内にAI多指ハンドプラットフォームの国内公開を掲げています。事業は次の柱です。
- 熟練作業の映像を動作データ化し、クロスエンボディメントで学習させる。ロボット貸出、オペレーター付き派遣
- AI多指ハンドをハードとソフト一体で販売、タスク合わせ・再調整・保守
- アニマトロニクス由来の技術でキャラクターに身体を与える
技術特長として、接触リッチな多指ハンドと、データ収集→基盤モデル追加学習→実機展開までを一つのプラットフォームで回す、と発表しています。対象は硬い産業部品から不定形の食品までです。
設立直後のXでは、多指ハンドの模倣学習パッケージを作っており、データ収集手法を試行錯誤している、CGによる収集は高品質に感じる、ソフト上は理想に近づいているが実機側はもっとチューニングが必要、と書いています。公式要旨の「一周させた経験」と、この公開投稿は同じ作業を指している可能性が高いです。
要旨が切っているボトルネック
成功率がモデル単体で決まらない、と先に宣言しています。切れ目は4つです。
- ハンドの機構と精度
多指は関節数、配線、バックラッシ、剛性、耐久、センサ配置が同時に効く。精度が出ないと、同じデモを繰り返しても軌道が散る。 - 遠隔操作によるデータ収集
リーダー・フォロワーやグローブ、CG経由の収集。南里氏自身が収集手法を試行錯誤している、と公開しています。 - アノテーション
接触、把持の成否、力、対象物の状態。映像だけ残しても学習に落ちない。 - 学習
ここに来る前の3段でデータが汚れていると、モデルを大きくしても成功率は上がらない。
「オープンソースのハンドを改造し、収集から学習までを自前で一周させた」が、この講演の一次資料です。既製グリッパやOpenArm標準の平行グリッパでは足りない作業(柔軟物、工具、ボタン、袋、食品)を、このセッションが担当します。指の本数やセンサ構成の製品スペック、成功率の数値は公開要旨にありません。
休憩前の最後です。後半のアーム・検品・産業ロボットは、この「手とデータの一周」の上に載ります。
株式会社ABEJA
エンボディド インテリジェンス グループ/データサイエンティスト
岩城 史享 氏
基盤モデルのヒューマノイド型ロボットアームへの適用における試行錯誤(14:20-14:45)
公式要旨
Physical AIの社会実装には,進化を続ける多様なロボット基盤モデルを、いかに実世界のロボットへ適用していくかが鍵となります。本登壇では、ヒューマノイド型ロボットアーム「OpenArm」を用いた双腕協調動作をVLAで実現する際の試行錯誤や強化学習の活用といった弊社での取り組みをご紹介します。今後の展望も含め、実践の現在地と将来像をお話しします。
岩城氏個人の詳しい経歴は、公開ウェブ上ではほぼ見つかりません。肩書は上記のとおりです。南里氏が「ハンドと収集パイプラインを一周した話」なら、こちらはオープンなヒューマノイド型アームに既存の基盤モデルを載せる側の試行錯誤です。
題材になっている OpenArm
OpenArm は東京の Enactic が公開している、完全オープンソースの7自由度ヒューマノイドアームです。フィジカルAI研究向けに設計されています。
公開スペックの要点:
- 片腕7軸、人間スケール(身長160-165cm相当)
- 定格可搬 4.1kg / ピーク 6.0kg
- QDD(準ダイレクトドライブ)でバックドライバブル
- リーダー・フォロワー、バイラテラル力覚フィードバック
- CAD / ファーム / ROS 2 / Isaac Lab / MuJoCo まで公開
- 双腕一式は研究用途として比較的安価(公開価格帯はおおよそ6,500ドル前後)
要旨の「ヒューマノイド型ロボットアーム」は、全身ヒューマノイドではなく、上半身型の双腕OpenArmを指しています。接触の多い作業、テレオペ収集、模倣学習、実機評価まで一通り回せる研究用デファクトになりつつある機体です。
ABEJA内部の公開スライドでも、SO-101、OpenArm Mini、OpenArm KER、OpenArm Leader/Follower、VRコントローラをデータ収集手段として並べ、集めたデモを π0.5 や SmolVLA に流す、と書いています。この講演の実験装置は、その延長だと見てよいです。
要旨が言っている「試行錯誤」の中身
公式テキストから分解できる論点は3つです。
- 多様な基盤モデルを実機へ載せる
モデル単体のベンチマークではなく、OpenArmという特定機体への適用。カメラ配置、関節表現、アクション空間、制御周波数の食い違いがここで出る。 - 双腕協調をVLAでやる
単腕のpick-and-placeより一段難しい。持ち替え、受け渡し、向きの変更、両手で同じ物を扱う、といった協調が主題。 - 強化学習の活用
模倣学習(デモ)だけでは双腕の接触作業が足りず、後段でRLを足している、という意味。直前のW&B講演(trajectory-level GRPO)と技術的に接続する話です。
「成功しました」ではなく「試行錯誤」「現在地と将来像」と書いているので、成功率の数字よりも、どこで折れたかの報告が中心になる可能性が高いです。
ABEJA側の公開実績との対応
ABEJAは上場企業(5574)で、本業はABEJA Platformによるミッションクリティカル業務のAI運用です。フィジカルAIは「LLMの次に伸ばす柱」としてIR資料に明記されています。直近の公開案件は、この講演の主張と重なります。
|
時期 |
内容 |
この講演との関係 |
|
2025年3月 |
AIRoA正会員 |
ロボットデータエコシステム |
|
2026年7月 |
NEDO「製造現場視触覚データ → VTLA基盤モデル」に参画(川崎重工・ファナック・安川・阪大・FingerVision) |
視覚に触覚を足した基盤モデル |
|
2026年8月 |
村田製作所と共同検証。VLAで双腕の「部品の持ち替え」に検証環境下で成功 |
双腕協調そのもの |
|
2026年9月 |
JR東日本 TAKANAWA GATEWAY CITY。双腕で荷物の認識・把持・積み込み |
現場寄りの双腕作業 |
|
2026年9月 |
防衛装備庁とVLAのUGV適用・「VLAOps」要件整理 |
運用基盤側 |
特に村田製作所案件は、講演要旨とほぼ同じ作業です。カメラ画像からVLAが推論し、「左で掴む → 右に持ち替える → 向きを変えてラックへ入れる」を実機で成立させた、と発表しています。検証環境下、と留保は付いています。このセッションでは、その裏側の失敗や調整、OpenArm固有の問題まで踏み込む、と読むのが自然です。
ABEJAが繰り返し使う言葉は VLAOps です。モデルを一度動かして終わりではなく、追加学習と継続運用の型を作る、という立場です。LLMで培った運用基盤をロボットに横展開する、というのがIR上のストーリーです。
双腕VLAで公開情報から想定される詰まりどころ
講演の中身ではありませんが、要旨とABEJAの公開スライド、OpenArmの設計思想から、話に出てきそうな層です。
- データ収集コスト
双腕リーダー・フォロワーは高い。ABEJA資料はVRテレオペ(Quest 3S)なら半額近くになる、と比較している。 - 重力補償と操作性
OpenArm片腕約5.5kg。補償を誤るとデモが汚くなる。 - カメラとアクション空間の不一致
手元カメラ、頭部カメラ、関節指令の次元・周波数がモデルごとに違う。π0.5とSmolVLAでは前処理が割れる。 - 双腕の信用割り当て
持ち替えは「どちらが悪いか」が分かりにくい。軌跡単位RLが必要になる理由。 - 接触とコンプライアンス
OpenArmはバックドライバブルなので安全だが、硬い産業アーム用に学習したモデルはそのままでは力の出し方が違う。
25分なので、個別論文の再現というより、適用時に効いた設定と効かなかった設定の列挙になると見てよいです。岩城氏個人の経歴・過去論文は公開検索ではほぼ出ません。講演で使うVLAの機種は要旨にありません。村田製作所案件をそのまま話すのか、OpenArm上の別タスクなのかも不明です。強化学習をどのアルゴリズムで、シミュレーションか実機かも未公表です。
株式会社メルカリ
研究開発組織 R4D Head of Research
小堀 訓成 氏
AIロボットを活用した検品作業の自動化に関わる研究開発(14:45-15:10)
公式要旨
越境取引の拡大にともない、海外へ発送する商品をいったん国内の自社倉庫に集めて検品する作業が増え続けています。検品作業はロボットを投入したときの効果が最も大きい工程の1つです。今回は靴の検品作業の自動化に取り組みました。いまのロボットを動かすモデルには、力加減の制御が難しい、カメラの位置が変わると精度が落ちる、学習データを集めるのが困難という 3 つの限界があります。それぞれに対して、メルカリの開発事例の取り組みを紹介します。
ABEJAが「オープンな双腕アームにVLAを載せる試行錯誤」なら、こちらは自社倉庫の実作業(靴の検品)で、その限界がどう現れるかです。C2Cの現場タスクを題材にした最初のセッションです。
登壇者
小堀 訓成(Norimasa Kobori)氏は、メルカリ研究開発組織 R4D 所長(Head of Research) です。2025年9月着任。
公開経歴:
- 早稲田大学 ヒューマノイドロボティクス研究所で修士
- ソニー、トヨタ自動車、Toyota Motor Europe(イメージセンサ、ロボティクス、自動運転、海外研究統括)
- 名古屋大学で博士
- Woven by Toyota / Woven Alpha で Principal Researcher、Woven City周辺のAI開発に関与
- トヨタ勤続約20年のあと、2025年8月末に退職してメルカリへ
研究マネージャというより、ロボティクスと実世界AIの実務経験がある所長が、自社案件を直接話す枠です。
なぜメルカリがロボット検品をやるのか
公開されている事業上の理由は単純です。
- 2025年9月に世界共通アプリ「メルカリ グローバルアプリ」を開始
- 越境取引は直近数年で急拡大(AWS成果発表では「過去4年で19倍」、2028年に50か国超を目標、と報じられている)
- 海外発送では、写真と出品情報が一致しているかの検品が必須
- 扱う物は型番のない中古・一点物が多く、衣料やバッグのような柔軟物、ボタンやファスナー付きも混ざる
- 従来のモデルベース制御では自動化しにくい
R4Dのロボティクス領域の定義もこれに揃っています。開梱、検品、真贋、撮影、梱包、発送といったC2Cの物理工程をロボットに置き換える、と明記しています。靴はその中で「工程が多く、ロボットを入れる効果が大きい」対象として選ばれています。AWS成果発表では靴検品を9ステップと紹介されています。
小堀氏はAWSプログラムの成果発表で、2028年までに自社倉庫の20%を自動化し、年間2億円のコスト削減を目標にすると話しています。研究発表というより、事業KPI付きの開発報告です。
公式要旨が挙げる3つの限界と、公開されている対処
イベント要旨の3点は、R4Dの研究テーマおよびGENIAC採択内容と一致します。
|
要旨の限界 |
公開されている取り組み |
|
力加減制御が難しい |
触覚・力覚を足したマルチモーダルVLAへ拡張。視覚偏重で手先が雑になる問題への対処 |
|
カメラ位置が変わると精度が落ちる |
Camera Aware VLA。学習時と推論時で視点が違う問題。合成画像で推論時視点を補う、とも説明されている |
|
学習データ収集が困難 |
人が作業する感覚をロボットへ移す収集基盤。AWS成果発表では UMI(Universal Manipulation Interface)で収集を簡易化した、と紹介 |
GENIAC(2026年9月9日採択)では、実証環境をメルカリの検品・配送拠点に置き、上記3本を国家プロジェクトとして進める、と発表しています。セッションタイトルは「検品」に絞っていますが、採択テーマは「出品および検品」です。撮影や出品情報との照合まで含む可能性があります。
AWSジャパンのフィジカルAI支援プログラム(2026年3月採択、8月末に成果発表)では、すでに靴検品に絞ってこの3課題を検証した、と報じられています。10月の講演は、その延長をGENIAC採択直後に話す形です。
技術的な位置づけ
メルカリが公開で使っている言葉を整理すると、次の層です。
- 対象作業
靴の検品。多数ステップ。柔らかい物、不定形、状態確認が混ざる。 - ベースモデル
映像と言語から行動を出すVLA。 - 拡張
触覚・力覚を入れたマルチモーダルVLA。製造向けにABEJAが関わるVTLA(Vision-Tactile-Language-Action)と同じ方向。 - 視点ロバスト性
Camera Aware VLA。倉庫ではカメラ位置が固定しきれない、という現場制約。 - データ
テレオペだけではなく、人の実作業をロボット学習に変換する。UMIはその一例。
中古靴は新品ラインと違い、汚れ、型崩れ、紐、中敷き、箱の有無が毎回違います。モデルの汎化が問われる題材です。使っているロボット機種(双腕のメーカー、ハンド)は未公表です。靴検品の成功率やスループットの数値は出ていません。UMIやCamera Aware VLAの実装詳細は成果発表の要約レベルです。「倉庫20%自動化・年2億円削減(2028年)」は目標であり、現状の達成度は不明です。
ファナック株式会社
ロボット研究開発統括本部 ロボット機構研究開発本部 技師長
森岡 昌宏 氏
ファナックのオープンプラットフォーム戦略とフィジカルAIの実践(15:10-15:35)
公式要旨
世界中の生産現場で累計100万台以上稼働するファナックロボットは、ROSやPythonなどのオープンプラットフォーム対応により、フィジカルAIの社会実装を加速します。本講演では、ファナックロボットの豊富なラインアップと高信頼性、オープンプラットフォーム、高精度なデジタルツイン環境など、最新ロボット技術を通して、「見て、考えて、動く」フィジカルAIよる自動化の実践事例を紹介します。
産業用ロボットメーカーが「閉じたティーチング文化」から、ROS 2 / Python / 高速外部指令で外のAIを載せる側へ開く、という話です。メルカリが「自社倉庫の靴検品」なら、こちらは工場に既にある産業ロボットを、フィジカルAIの実行基盤にする立場です。
ファナック公式の定義も明確です。フィジカルAIを「仮想空間だけでなく物理空間で自律動作するAI」とし、自社の役割をモデル開発そのものより、信頼できるロボットをオープンに動かす土台に置いています。2023年にロボット累計100万台を達成しています。
登壇者
森岡 昌宏(もりおか まさひろ)氏は、ロボット研究開発統括本部 ロボット機構研究開発本部 技師長 です。
公開経歴:
- 1999年3月 東京大学大学院 工学系研究科 精密機械工学専攻(修士)修了
- 同年4月 ファナック入社、ロボット研究所で機構設計
- 2011年 ロボット研究所 開発部長
- 2019年〜 ロボット機構開発研究所(現・ロボット機構研究開発本部)技師長
機構屋のトップが話す、というのがポイントです。ソフトウェア広報ではなく、可搬3kgから2.3トンまでの実機を設計してきた側の話になります。2025年12月の学生向け講演「日本のものづくりを支えるロボット」でも同氏が登壇しています。
オープンプラットフォームの3本柱
2025年12月の国際ロボット展前後から、公式にこの3点で固定されています。
|
柱 |
中身 |
意図 |
|
ROS 2公式ドライバ |
GitHub公開。ros2_control対応。1ms周期 |
研究・スタートアップのソフトを実機に直結する |
|
Pythonネイティブ実行 |
コントローラ上でPythonを直接実行。PC経由不要 |
AI側の言語を工場コントローラに載せる |
|
Stream Motion |
位置・速度・トルクを1msで外部指令 |
外部で生成した軌跡を滑らかに実機へ流す |
対象は協働ロボットCRXだけでなく、可搬3kgの小型から2.3トンの大型まで、と繰り返し書かれています。研究室の小型アームだけ開く、という話ではありません。工場の主力機に同じI/Fを付ける、という宣言です。
山口賢治社長も2026年2月のインタビューで、同じ3点を「フィジカルAI実装を加速するため」と説明しています。会社方針であり、一部署の実験ではありません。
公開されている協業
特設ページはパートナーを2社に分け、その後富士通連合が加わっています。
NVIDIA
- Isaac Sim にファナックロボットを OpenUSD SimReady 資産として載せる
- 自社シミュレータ ROBOGUIDE と Isaac Sim をリアルタイム接続し、実機と同じ軌跡・サイクルタイムを仮想工場で再現
- Jetson Thor を使ったエッジ構成
- Isaac GR00T による模倣学習の実証開始、と公式に書いている
冒頭のNVIDIA講演(荒井氏)で出る Isaac / Cosmos / GR00T を、産業ロボット側で受け取る話です。
- 2026年5月、Gemini Enterprise を使ったフィジカルAIロボットシステムを発表
- AIエージェントが指示を理解し、物体を認識し、複数台を動かすデモ
- 2026年9月、「AI溶接エージェント」を発表。図面を読ませて電流・電圧とロボット動作を自動生成。ゼロ設定・ゼロ教示を謳う。12月末出荷開始
- 既存のファナック契約のサブスクで使える、と現場導入を意識した販売形態
研究デモではなく、溶接という既存用途への製品化です。
富士通+安川+川崎重工
- 2026年7月、フィジカルAIの事業検討に合意
- Fujitsu Kozuchi Physical OS をオープン基盤として提供する構想
- NVIDIA技術も使う
- 2026年9月末に富士通かほく工場へ実装、12月までに3社へ提供、という日程が報道されている
ABEJAが参画するNEDO視触覚データ事業にもファナックは入っています。産業ロボット大手が、基盤モデル側と制御OS側の両方に顔を出している、という構図です。
公式が並べている実演例
オープンプラットフォーム特設ページの活用事例は、この講演で触れられやすい素材です。
- 音声で指示し、生成AIがPythonを書いて実行(多言語)
- 人を認識して作業を止めずに退避し、離れたら軌道復帰
- 双腕で柔らかいケーブルを張りを見ながら配線
- 動く部品を追ってネジ締め
- 部品キッティングをAIエージェントで行う、という国際ロボット展以降の話
- 山梨大学とのぶどう摘粒(農業への横展開)
共通しているのは、従来のオフラインティーチングを「言葉・視覚・接触」に置き換える、という見せ方です。サイコロの目に応じて置く、色の上に積む、といった場合分けは、生成AI側の例として社長インタビューでも使われています。
25分なので、3本柱の説明、NVIDIA / Googleのデモ、溶接エージェントのような製品化事例、という順になりやすいです。機構技師長が話す以上、精度・可搬・安全性の制約も出る可能性があります。「ゼロ教示」は溶接エージェントの宣伝文句であり、現場の歩留まりは未公表です。GR00T模倣学習は「実証開始」段階です。富士通連合のPhysical OSは事業検討と実装日程が出ているだけで、APIや責任分界は見えません。従来の教示言語(TPプログラム)とPython / ROS 2を現場でどう共存させるかは、公式文では触れていません。
アマゾン ウェブ サービス ジャパン合同会社
プリンシパル スタートアップ ソリューション アーキテクト
針原 佳貴 氏
フィジカル AI 開発にクラウドが必要な理由(16:15-16:35)
公式アジェンダでは、15:35-15:45休憩のあと 15:45-16:15 がパネル、その直後がこの枠です。
公式要旨
フィジカル AI の開発には、データの収集・前処理パイプラインの構築、VLA や WAM など基盤モデルの学習・ファインチューニング、シミュレーションと Sim2Real、そしてエッジへのデプロイ・オーケストレーションなど広範な技術が求められます。本セッションでは、AWS のクラウドサービスを活用することでこれらの開発をいかに効率的に進められるかを、フィジカル AI 開発支援プログラムを通じた実例を交えてご紹介します。
タイトルが主張です。モデルや機体の話ではなく、学習・シミュレーション・データ拡張をオンプレだけで回すのは現実的でない、というインフラ側の主張です。ファナックが「実機を開く」なら、AWSは「その前段の計算とデータの置き場」です。要旨がVLAとWAMを並記している点は、冒頭の荒井氏と同じ語彙です。
登壇者
針原 佳貴(はりばら よしたか)氏。公開肩書は時期で少し変わっていますが、イベントページは プリンシパル スタートアップ ソリューション アーキテクト、他資料ではフロンティアAI/シニアなどと併記されます。大阪大学 量子情報・量子生命研究センター 招へい准教授。
公開経歴:
- 大阪大学理学部数学科卒、東京大学大学院情報理工学系研究科で博士(量子光学・組合せ最適化)
- 2018年 AWS Japan 新卒入社
- 生成AIスタートアップ支援、2023年「AWS LLM開発支援プログラム」立ち上げ
- GENIAC第2期の採択事業者支援
- 2026年1月「フィジカル AI 開発支援プログラム by AWS ジャパン」を発足
- 著書『AWS生成AIアプリ構築実践ガイド』
- X: @_hariby
LLM支援を日本で先に回した人が、同じ型をフィジカルAIに横展開している、というのがこの枠の意味です。成果発表会の総括も同氏が担当しています。
AWSが公開している「クラウドが必要な理由」
公式のリファレンスは、開発を3ステップの循環として切っています。
- データ生成・収集
実機デモだけでは足りない。Isaac Sim 等の並列シミュレーション、合成データ、遠隔操作データの拡張。 - モデル学習
VLA / 世界モデルのファインチューンや大規模学習。単一GPUでは足りず、クラスタが要る。 - 配信・推論
学習済みモデルをエッジ(ロボット、Greengrass)へ配り、現場データをまたクラウドへ戻す。
クラウドに置く理由として、公開資料から拾えるのは次の層です。
- 計算のバースト
学習とシミュレーションは常時フル稼働ではない。必要なときだけ数百GPUを借りる方が、オンプレ固定より速い。 - データ不足の穴埋め
FastLabelは遠隔操作90パターンを約100倍に伸ばし、不正を除いて1万パターンにした。タスク成功率は平均14.2%改善。実機だけでこの規模は取れない。 - シミュレータの並列
レンダリング向けに G6e / G7e(L40S や RTX PRO 6000 Blackwell)を推奨、と勉強会で説明している。 - 学習クラスタ
SageMaker HyperPod、AWS ParallelCluster、Capacity Blocks for ML。HighlandersはParallelClusterで1,000億パラメータ級を24時間学習、と成果発表で紹介された。 - エッジとの循環
IoT Greengrass でモデル配信、S3 / FSx for Lustre でデータ溜め、また学習へ戻す。制御そのものは現場、改善ループはクラウド、という分担。
「フィジカルAI=全部エッジ」という誤解への反論が、このタイトルの核です。制御のミリ秒は現場、学習とデータ拡張はクラウド、が公式の整理です。
針原氏は成果発表会で、こう総括しています。基盤モデルの学習、大量のデータの収集と前処理、何百通りものシミュレーションを並列で走らせることをオンプレミスだけで行うのは、時間もコストも現実的ではない。必要なときに必要な規模の計算資源を確保できることは、フィジカルAIの開発において選択肢のひとつではなく不可欠である、と。
プログラムで実際に起きたこと
2026年1月27日開始、51社採択(半数以上がスタートアップ)、クレジット総額最大600万ドル、3〜8月に支援。成果発表会では記者向け13件、全体で26プロジェクトを紹介しています。
このイベントの登壇社との重なりもあります。
- メルカリがプログラム採択企業。分散学習をAWS上で実施、靴検品9工程、2028年倉庫20%自動化・年2億円削減が目標
- NVIDIA勉強会をAWS目黒で開催し、Isaac / GR00T / データ生成フェーズのインスタンス選定を説明
- Physical AI Scaffolding Kit(PASK)を公開。SageMaker HyperPod 上で GR00T や π0 をコンテナでファインチューンするサンプル
針原氏の講演は、抽象論ではなく、メルカリ事例やファナックが接続するIsaacスタックを、クラウド側から同じ絵で説明する枠です。
成果発表で「計算規模が効いた」と明示された例:
|
企業 |
クラウドでやったこと |
|
Telexistence |
複数GPU分散学習。100億パラメータで成功率86%(公開事前学習80%、事前学習なし50%) |
|
FastLabel |
90→10,000パターンへ合成拡張。成功率+14.2% |
|
Highlanders |
ParallelClusterで大規模学習を常時回す |
|
MW |
年5万時間収集、S3→HyperPodの日次ループ。目標2.5PB |
|
ダイフク×JDSC |
未学習品の仕分けをシミュレーションで100件中97件成功 |
|
リコー |
共通表現でシミュ3機種・実機1機種。モデル規模を1/3にしてもLIBERO-10で性能維持 |
|
豆蔵 |
位置合わせ成功 上下85%・左右80%。パターンを2,000超から43へ |
そのほか成果発表に出た社として、アトム(歩行と仕分け、8月28日に24時間連続運転デモ、将来200台・30万時間・数百億パラメータ)、オムロンサイニックエックス(3か月で特許・論文3件)、ZEALS(データ変換10倍、病院デモ、2026年に100台・1万時間目標)、竹中工務店、NRIなどがあります。
公開アーキテクチャの骨格
GENIAC向けDeep Dive(2026年4月、針原氏登壇)の図が、講演スライドの原型になりやすいです。
- 実機 / シミュレータ → S3 / FSx
- 学習: SageMaker HyperPod または ParallelCluster
- シミュレーション: EC2 G7e 等
- 推論配信: SageMaker Inference と IoT Greengrass
- 開発者の手元: Remote AWS Develop Station(遠隔デスクトップでGPU開発)
PASKは「GR00Tとπ0をHyperPodで回す型」を先に配るためのキットです。基盤モデルを自前で一から組む前に、公開VLAをクラウドでファインチューンする、という実務寄りの入口です。
LLM支援プログラム(2023)→ GENIAC支援 → フィジカルAIプログラム(2026)という同氏の通時的な話も出やすいです。成果発表会では「今後は生成AI実用化推進プログラムに統合して支援を続ける」と明言しています。
「クラウド必須」は学習・シミュレーションの話であり、制御ループ自体をクラウドに置けとは公式も言っていません。クレジット600万ドルはプログラム全体で、1社あたりの実額は非公開です。PASKやリファレンス構成はサンプルであり、現場の安全認証や閉域網制約は別問題です。成果発表の成功率は各社自己申告で、統一ベンチマークではありません。
7本を通して、公開情報から言えること
- モデルよりループ
NVIDIAもAWSも、単体スコアより「データ→学習→実機→再学習」を先に置いています。荒井氏のパイプライン/品質/ベンチマークと、針原氏の3ステップ循環は同じ絵の両端です。 - 接触と双腕が、いまの実務テーマ
南里氏の多指、岩城氏の持ち替え、小堀氏の靴、ファナックのケーブル配線は、いずれも平行グリッパと単腕模倣では足りない領域です。 - 軌道単位の学習とログが必要になる理由が揃っている
双腕の信用割り当て、力加減、視点変化はステップ損失だけでは見えません。山本氏のGRPOとAdvantage collapse、W&Bの映像+トレースは、その観測装置です。 - 工場側は「開く」フェーズに入っている
ファナックのROS 2/Python/1ms指令は、研究用OpenArmやVLAを既存設備へ落とすI/Fです。累計100万台、という設置ベースの上に学習を載せる話です。 - クラウドは制御の代替ではない
学習と合成データとクラスタのため、という切り方で、AWSもファナックも矛盾していません。 - 語彙がイベント全体で揃っている
VLAとWAMは荒井氏と針原氏の要旨に同じ並びで出ます。OpenArm、GR00T、π0/SmolVLA、Isaac Sim、UMI、Camera Aware VLA、VLAOps、Stream Motionが、セッションをまたいで同じスタックを指します。 - 数字はまだ目標が多い
検証環境下の成功、2028年の倉庫20%、溶接エージェントの出荷開始、プログラム成果の自己申告成功率。現場の歩留まりは、当日の留保を見る必要があります。
公開されているのは要旨と、各社がイベント前に出しているプレス・特設ページ・成果発表・IR・登壇者の過去資料までです。講演でどのデモを出すか、どのモデル名を出すか、失敗をどこまで話すかは、当日資料を待つしかありません。15:45-16:15のパネルは公式要旨がありません。このメモは予習用で、議事録の代わりにはなりません。