研究と社会

Skild AIの「S1」、動画1本を見せるだけでロボットが10分の作業をこなす。言語指示より7倍高い成功率

Skild AI が、ロボット基盤モデル「S1」を公開した。言語で指示するのではなく、動画のデモンストレーションをそのままプロンプトにする方式で、ファインチューニングなしに未学習の長時間タスクを実行する。未学習タスクの成功率は言語プロンプト方式の9%に対し66%。ただしパラメータ数もアーキテクチャも非公開。

Skild AI(米ペンシルベニア州ピッツバーグ)が、ロボット基盤モデル「S1」を公開した。公式ブログの日付は2026年8月18日、公式Xでの告知は8月25日となっている。

S1(Skild AI)

特徴は指示の与え方にある。言語で「コーヒーを淹れて」と伝えるのではなく、人がやっている動画を1本見せる。それをプロンプトとして、ロボットが同じ作業を実行する。同社はこれを in-context learning(ICL)と呼び、こう書いている。

“No fine-tuning, no post-training. The same model weights produced every example shown in this blog.”

数字で見る差

同社は同一データ・同一アーキテクチャ・同一計算量で、ICL 方式と言語条件付け VLA を比較した実験を公開している。

条件言語プロンプトICL(S1)
学習済みタスク・事前学習1k時間53%43%
学習済みタスク・スケール後—96%
未学習タスク・事前学習10万時間9%66%

評価に使われたのは4〜8分のロングホライズンタスク。注目すべきは、データが少ないうちは言語指示のほうが強い(1k時間で53%対43%)が、スケールさせると逆転し、未学習タスクでは7倍の差がつくという点だ。

同社は「文脈内の1本のデモは、約380回のポストトレーニング用エピソードに相当する」とし、その380本のロングホライズンデモを集めるにはテレオペレーションで50〜100時間を要したと書いている。1本の動画がその工数を置き換えるという主張になる。

ロバストネスの評価も具体的だ。物体を15cm・30°ずらす(L2)、30cm・45°ずらす(L3)、同じ用途の別物体に入れ替える(L4)、ロボットの動作の半分を反対側の腕でやらざるを得ない配置にする(L5)といった摂動を加えたとき、L5では言語プロンプト方式が ICL の最大3倍劣化したとされる。

デモとして挙がっているのは鉢植え、パンケーキ調理、ハンドドリップコーヒー、キット組み立てで、いずれも最長10分・数十の操作ステップを含む。鉢植えのタスクでは、材料がオフィスに届いてから自律実行まで33分、人のデモ動画を撮ってから実行開始までは11分だったという実測タイムラインも公開されている。

何が公開されていないか

一方で、モデルとして評価するために必要な情報の多くが伏せられている。

  • パラメータ数: 非公開
  • アーキテクチャの詳細: 非公開(「今後の投稿で学習方法を詳述する」と予告)
  • 最終モデルの総学習データ量: 非公開(1k〜10万時間は統制実験の条件)
  • 対応ロボットの機種・エンボディメント一覧: 非公開
  • 重みの公開・API・価格: いずれもなし

公開状況は「商用パートナーと稼働中」で、一般には早期アクセスの登録フォームがあるのみ。今回の投稿は「これから数ヶ月にわたって公開するシリーズの第1弾」と位置づけられている。

つまり現時点で外部から検証できるのは、同社が公開したデモ動画と、同社自身が実施した比較実験の数字だけだ。第三者による再現や、共通ベンチマークでの比較はない。

競合との位置関係

同社は競合として Generalist AI の GEN-1.5(“Embodied foundation models are one-shot learners”)と、RoboTTT(arXiv:2607.15275)を挙げ、「短いホライズンか、事前学習分布内のタスクに留まっている」と評価している。実際、Generalist の GEN-1.5 は自ら「短いホライズンの単純なタスクに限られる」と書いており、10分という長さで勝負をかけたのが S1 という構図になる。

Skild AI は2026年1月に SoftBank がリードする14億ドルのシリーズCを、評価額140億ドル超で完了している。2025年の売上は約3,000万ドルと公表されている。データについては「データ収集に1ドル使うごとに、品質管理に3ドル使う」という方針を示し、テレオペレーション・UMI・一人称視点動画・シミュレーションの4種を、ハードウェアとの近さ・多様性・スケーラビリティの3軸で比較した表を公開している。

ロボットに新しい作業を教える手段が「プログラムを書く」「教示する」「大量のデータで再学習する」だった時代から、「一度やってみせる」に近づいている——ただしそれが同社のデモの範囲を超えて成立するかは、重みが公開されていない以上、パートナー企業の実運用の報告を待つことになる。


出典