← Essays

Essays / essay

家庭ロボットは、何日に一度人間を呼ぶのか

物を拾う、卵を取る、服を畳む、水を注ぐ。家庭ロボットの実用性を、世界モデルと人間介入間隔から考える。

中国のロボティクス企業Spirit AIについての記事を読んでいて、家庭用ロボットには「次に何が起きるか」を予測する能力が必要なんじゃないか、と思った。

コップへ水を注ぐなら、水面がどこまで上がるかを見ながら手首を戻さなければならない。服はつかむ場所によって形が変わるし、卵は弱く持てば落ち、強く持てば割れる。工場の決められた動作と違って、家庭には剛体、液体、布、ケーブル、人間が同時にいる。

Reutersの2026年9月18日の記事によると、Spirit AIは構造化された環境での単純タスクで約90%の成功率に達した一方、家庭への導入には少なくとも8年ほどかかると見ている。90%から先に、何がそんなに残っているんだろう。

考えていくと、家庭ロボットの実用性を決めるのは、ベンチマークの単発成功率だけではない気がしてきた。

一日に何回、人間が救助へ行かなければならないか。

この量へ変換すると、90%、99%、99.9%の違いが生活の違いとして見えてくる。

物理世界を、完全には観測できない

ロボットが扱う本当の状態を sts_t、カメラや力覚センサーから得た観測を oto_t、実行した動作を ata_t とする。家庭では sts_t を直接知ることはできない。透明でない容器の残量、布の裏側、接触面の摩擦、人間の次の動きは、観測の外に残る。

そこで、観測と行動の履歴から現在状態についての信念 btb_t を持つ。

bt(s)=P(st=s∣o0:t,a0:t−1)b_t(s) = P(s_t=s\mid o_{0:t},a_{0:t-1})

これは家庭ロボットを部分観測マルコフ決定過程として見る書き方だ。実装が明示的な確率分布を保持するとは限らず、ニューラルネットワーク内部の潜在表現 ztz_t が同じ役割の一部を担うこともある。

現在の観測、ロボット自身の関節状態 qtq_t、目的 gg から、モデルが未来の潜在状態と短い動作列を同時に出すとする。

(z^t+1:t+H,at:t+H)=fθ(o≤t,qt,g)(\hat z_{t+1:t+H},a_{t:t+H}) = f_\theta(o_{\le t},q_t,g)

HH は予測するステップ数である。ただし、最後まで一気に実行するわけではない。数ステップだけ動き、現実をもう一度観測し、予測との差 ee を測る。

et+k=d(z^t+k,E(ot+k))e_{t+k} = d\left(\hat z_{t+k},E(o_{t+k})\right)

EE は新しい観測を潜在状態へ写す関数、dd は予測と現実の差を表す距離だ。差が小さい間は動作列を続け、閾値 δ\delta を超えたら再計画する。

k∗=max⁡{k≤H:et+j≤δ for all j≤k}k^* = \max\left\{ k\le H: e_{t+j}\le\delta\ \text{for all}\ j\le k \right\}

実際、2026年の研究 When to Trust Imagination は、予測した未来と実観測が整合する間は長く実行し、ずれたら早く再計画する方式を検討している。固定長のaction chunkより、頑健性と推論回数のバランスを改善したという。ただしこれはRoboTwinと限定された実機タスクでの結果で、家庭全体の実証ではない。

Spirit AIの公開モデル Spirit-v1.5 も、画像、ロボット状態、言語指示から一つ先の動作ではなくaction chunkを生成するVLAで、公開実装の既定chunk sizeは60である。後継のSpirit v1.6について同社は、マルチモーダル認識、未来状態予測、動作生成、リアルタイム再計画を統合したと説明している。ただしv1.6の詳細なアーキテクチャや損失関数は、公開ページだけでは分からない。

つまり、毎回Navier–Stokes方程式を解いて一滴ずつ追跡しなくてもよい。必要なのは、行動に必要な範囲の未来を短く予測し、現実で頻繁に答え合わせすることだ。

四つの家事は、同じ「操作」ではない

物を拾う、冷蔵庫から卵を取る、洗濯物を畳む、水を注ぐ。この四つを同じ軸へ置くと、難しさの場所が違う。

タスク隠れている主な状態主な観測必要な予測典型的な復旧
落下物を拾う位置、姿勢、把持可能性RGB-D、関節状態把持後の短い剛体運動別の位置で再把持
卵を取る摩擦、殻の強度、接触力RGB-D、力覚、触覚滑りと破損の境界把持力を修正
洗濯物を畳む布の形状、重なり、裏返りRGB-D、触覚引いた後の変形広げ直して再認識
水を注ぐ残量、流量、水位、容器形状画像、力覚、場合により音数十〜数百ms先の流れ傾きを戻して停止

落下物なら、失敗しても持ち上がっていないことを確認し、別の把持点を試せる。卵では、失敗を観測した時点で既に割れているかもしれない。布はそもそも現在状態を少数の座標で表しにくい。液体は状態が連続的に変化し、遅れて止まる。

この違いは、単なる成功率には現れにくい。同じ1%の失敗でも、「もう一度つかむ」と「床へ水をこぼす」は意味が違う。

だから世界モデルを、ここでは次の四つ組として考えてみる。

W=(P,D,R,U)W=(P,D,R,U)
  • PP はPrediction。「この動作をすると、次にどうなるか」
  • DD はDeviation detection。「予測通りになったか」
  • RR はRecovery。「外れた後、どう戻すか」
  • UU はUncertainty。「この予測を、どこまで信用してよいか」

予測だけが高精度でも、失敗を見つけられなければ開ループで進んでしまう。失敗を見つけても、復旧軌道を学んでいなければ毎回人間を呼ぶ。自信がない場面で止まれなければ、平均成功率は高くても損害の大きい失敗を起こす。

Google DeepMindもGemini Robotics On-Device 2のModel Cardで、VLAだけに安全を任せず、高水準の意味的安全性、衝突回避・バランス・力制御を担う低レベル制御、ハードウェア固有の機能安全を重ねる構成を推奨している。またASIMOV-Agenticの説明では、実行可能性の予測と、不確実なときに人間へ介入を求められるかを評価対象にしている。

「賢いモデルがモーターまで全部直接動かす」という一枚岩ではなく、学習モデルと従来制御、安全機構が異なる時間尺度で重なる形になるのだと思う。

95%を20回つなぐと、35.8%になる

家庭の仕事は、物を一度つかめば終わるわけではない。朝食準備が NN 個の下位タスクからなり、各タスクの成功確率を pip_i とする。独立で、途中の失敗が全体失敗になるという強い単純化を置けば、完遂確率は

Pjob=∏i=1NpiP_{\mathrm{job}} = \prod_{i=1}^{N}p_i

となる。全部が同じ成功率 pp なら pNp^N だ。20段階の場合を計算すると、

各段階の成功率 pp20段階すべての成功率 p20p^{20}
95%35.85%
99%81.79%
99.9%98.02%

もちろん現実の失敗は独立ではない。暗い部屋、未知の容器、センサーの汚れのような共通要因が、複数の動作をまとめて難しくする。表は製品性能の予測ではなく、長い仕事では「かなり高い単発成功率」も急速に削られることを示す計算例だ。

ただ、ここで本当に欲しいのは無失敗のロボットだろうか。物をつかみ損ねても、自分でやり直せるなら人間から見た失敗ではない。

一回の試行成功率を pp、検知可能で状態を悪化させない失敗について許す自律リトライ回数を rr とする。各試行を独立と仮定すれば、全試行に失敗して人間が必要になる確率 qq は、

q=(1−p)r+1q=(1-p)^{r+1}

になる。たとえば p=0.9p=0.9 でも、自律的に2回再試行できれば、

q=(1−0.9)3=0.001q=(1-0.9)^3=0.001

で、人間介入は0.1%まで下がる。

ただし、これはかなり厳しい仮定だ。服を引くたびに絡まりが強くなる、把持失敗で物が机から落ちる、といった場合、各試行は同じ分布ではない。復旧可能性そのものを状態へ含めなければならない。

成功率を、人間介入間隔へ変換する

一日にタスク種別 ii を nin_i 回行い、一回あたり人間が必要になる確率を qiq_i とする。一日あたりの期待介入回数 λH\lambda_H は、線形性から

λH=∑iniqi\lambda_H = \sum_i n_iq_i

となる。独立性は期待値の計算には不要だが、介入が何日もまとまって発生するかを知るには依存関係が必要になる。

ここで比較用に、**Human Rescue Interval(HRI)**という指標を仮置きする。既存の標準指標ではなく、このノートでの名前だ。カレンダー日で測るなら、

HRIday=1λH\mathrm{HRI}_{\mathrm{day}} = \frac{1}{\lambda_H}

とする。一日100回の介入機会があり、すべて同じ有効成功率 s=1−qs=1-q だと仮定すると、

有効成功率 ss期待介入回数/日HRI
90%10回0.1日
99%1回1日
99.9%0.1回10日
99.99%0.01回100日

90%のデモは十分に印象的でも、100回動けば期待値で10回、人間を呼ぶ。99%でも毎日一回だ。家電のように放っておける感覚は、99.9%以降でようやく見え始める。

さらに「期待値で30日に一回」ではなく、「30日間、95%の確率で一度も呼ばれない」を要求してみる。各機会が独立で、一日100回、30日間なら、

(1−q)3000≥0.95(1-q)^{3000}\ge0.95

したがって、

q≤1−0.951/3000≈1.71×10−5q \le 1-0.95^{1/3000} \approx1.71\times10^{-5}

となる。有効成功率では約99.9983%以上だ。

この数字を現実の要求仕様だと言いたいわけではない。ロボットが担当する回数、介入の定義、失敗の相関で値は変わる。ただ「月に一度も呼ばれない」を確率で書くと、90%から先に残っている距離が急に具体的になる。

同じ1%でも、失敗の値段が違う

HRIだけでも足りない。卵を割ること、水をこぼすこと、人へ衝突することを同じ一回として数えられないからだ。

タスク ii の一回あたり価値を viv_i、自律完了確率を sis_i、人間救助確率を qiq_i、回復不能な損害の確率を cic_i とする。人間救助の平均負担を CiHC_i^H、損害の平均負担を CiFC_i^F、ロボットの日割り費用を CRC_R と置けば、一日の便益を説明する簡略モデルは、

Uday=∑ini(visi−CiHqi−CiFci)−CRU_{\mathrm{day}} = \sum_i n_i \left( v_is_i-C_i^Hq_i-C_i^Fc_i \right) -C_R

と書ける。各量の単位を円相当の負担へ換算した、この記事独自のモデルだ。

ただし人身事故のような事象は、平均費用へ押し込めるだけでは不適切だろう。重大失敗には別の安全制約を置く必要がある。

∑inici≤ε\sum_i n_ic_i\le\varepsilon

ε\varepsilon は許容する一日あたり重大失敗確率の上限で、社会的・法的・工学的に決める値だ。僕にはその妥当な数値は分からないし、用途や法域ごとに安全・機能安全の専門家による設計が必要になる。

ここまで来ると、商品価値は「できる家事の種類」だけでは決まらない。

Utility≠Capability alone\text{Utility} \neq \text{Capability alone}

むしろ、能力、介入頻度、失敗損失、安全制約の組み合わせで決まる。

高品質データは、成功例だけでは足りない

Spirit AIは、インターネット動画、ウェアラブル機器で集めた人間の操作、実機データを大規模事前学習へ使い、配備後のフィードバックで改善する構想を示している。同社の発表では、データをモデル進化の主要なボトルネックと位置づけている。ただしデータ点数やスケーリング則は企業自身の発表であり、第三者が同じ条件で再現した結果とは分けて読む必要がある。

ここで「高品質」を、きれいな成功軌道だけだと考えると足りない。

家庭で遭遇する状況を xx、その分布を DhomeD_{\mathrm{home}} とすると、方策 π\pi の失敗確率は、

Pfail(π)=∫P(fail∣x,π) dDhome(x)P_{\mathrm{fail}}(\pi) = \int P(\mathrm{fail}\mid x,\pi) \,dD_{\mathrm{home}}(x)

である。よくある机とコップを何度も成功させても、分布の端にある濡れた容器、透明な液体、変形した紙パック、途中で差し込まれる人の手を覆えなければ、家庭全体の失敗率は下がらない。

発生確率 rr の希少状況を nn 回の独立な収集で一度も見ない確率は、

P(N=0)=(1−r)nP(N=0)=(1-r)^n

である。発生率 r=10−4r=10^{-4} の状況を少なくとも一度、95%の確率で見るためには、

n≥ln⁡0.05ln⁡(1−10−4)≈29956n \ge \frac{\ln 0.05}{\ln(1-10^{-4})} \approx29956

回が必要になる。一度見ただけでは学習も評価も難しいので、実際の必要量はさらに大きい。この導出は、以前考えた宇宙装置のゼロ故障試験と同じ構造になっている。

それなら価値が高いのは、成功例の追加だけではない。

  • 予測が外れ始めた瞬間の観測
  • 失敗を検知できた例と、見逃した例
  • 人間がどう復旧したか
  • 再試行で状態が悪化した例
  • 未知の対象に対して停止した例

配備後のデータループを式で単純化するなら、

Dk+1=Dk∪Drollout∪Drecovery∪Dintervention\mathcal D_{k+1} = \mathcal D_k \cup\mathcal D_{\mathrm{rollout}} \cup\mathcal D_{\mathrm{recovery}} \cup\mathcal D_{\mathrm{intervention}}

となる。Drollout\mathcal D_{\mathrm{rollout}} は実運用軌道、Drecovery\mathcal D_{\mathrm{recovery}} は自律復旧、Dintervention\mathcal D_{\mathrm{intervention}} は人間救助のデータだ。モデルが賢くなるほど遭遇する失敗の分布も変わるので、固定データセットだけで終わる問題ではない。

Spirit AIが実世界データを重視する理由は、平均的な成功動作を教えるためだけではなく、HRIを決める裾の失敗と復旧を集めるため、と解釈すると分かりやすい。

何を測れば「家庭へ近づいた」と言えるか

今後のロボット発表を見るなら、僕は次の値を見たい。

  1. タスクごとの単発成功率だけでなく、連続運転時間あたりの人間介入回数
  2. 自律リトライ後の有効成功率と、リトライで悪化した割合
  3. 既知環境と未知環境を分けたHRI
  4. 物損につながらない失敗と、重大失敗の別集計
  5. 予測誤差を検知して停止できた割合
  6. 人間介入データを追加した後、どの失敗群が減ったか

HRIだけを最適化すると、ロボットが何もせず停止して人を呼ばない、という抜け道もある。したがって、完了した有用タスク数、安全制約、介入間隔を同時に測らなければならない。

家庭ロボットに必要なのは、未来を完全に言い当てる頭脳ではなさそうだ。短く予測し、動き、見直し、外れたら戻り、分からないときは止まる。その循環を、人間が忘れていられる長さまで延ばすこと。

「2027年にrobot brainが大きく進む」と「家庭に置いて一か月放っておける」は、別のマイルストーンだ。両者の間にある距離は、モデルのパラメータ数より、何日に一度こちらが助けに行くのかで測るほうが、生活には近い。

Sources

Related notes つながる問い

  1. コーヒーの最後の一滴を、ロボットはどう待つのか

    ドリッパーを移す瞬間の判断を、次の滴下までの予測と、失敗を小さくする動作設計へ分ける。

  2. 宇宙に置いた装置の99.99%は、何の確率なのか

    宇宙兵器のニュースから派生した、待機・故障・観測と信頼性の問い。SFのリアリティを支える条件を考える。