研究と社会

最初に止まった先は20回中15回が別の物。暮らしの隣で働くロボットの研究4本を、評価の中身まで読む

視覚障害者の探し物を代行する四足ロボット、高齢者の思い出話を覚えておく音声コンパニオン、家族の気配を運ぶロボットペット、失敗したときに人へ尋ねるべきかを決めるロボット。2026年9月にarXivへ出た査読前の論文4本を、被験者数と実験条件から読み解く。

探し物を頼まれたロボットが、黒い傘の前で止まる。だがそれは頼んだ人の傘ではなく、隣に立てかけてあった別の傘だった。頼んだ人が目で確かめられないなら、ロボットの「見つけました」はそのまま信じられてしまう。

2026年9月、人の暮らしに入るロボットを扱った論文が arXiv に相次いで出た。ここでは、視覚障害者の探し物、高齢者の思い出話、離れて暮らす家族とのつながり、作業に失敗したロボットが人に助けを求めるタイミングを扱った4本を読む。いずれも査読前のプレプリントで、結論はこの先変わりうる。そのうえで、何人に、どんな条件で試したのかを本文から拾う。

RoboFind のスマートフォンアプリ。左が「Find an item(探す)」「Teach a new item(教える)」と登録済みの私物一覧、中央と右が黄色いAR目印に沿って対象物を撮影する教示画面(arXiv:2609.20330 Fig. 2、CC BY 4.0)

RoboFind:止まった場所を「候補」として扱い、登録した私物と照合する

RoboFind は、ドイツのカールスルーエ工科大学(KIT)の Institute for Anthropomatics and Robotics と中国・湖南大学の研究者13人による論文だ。v1 は2026年9月17日、v2 は翌18日に公開された。

狙いは、視覚障害や弱視のある人が「黒いリュック」ではなく「自分の黒いリュック」を探したい場面だ。スマートフォンや身につける機器で探す既存の方法では、本人が部屋を歩き回ってカメラを向ける必要がある。RoboFind はその移動と視点の確保を四足歩行ロボット「Unitree Go2」に任せる。

手順は2段階ある。まず利用者がアプリで物の名前を言い、正面・側面・上面と、背景を変えたもう1本の計4本の動画を撮る。アプリはAR目印、音声、振動、VoiceOver で撮影を誘導し、端末が約0.40m動き、目印が画面内に累計4秒以上とどまると1本の撮影が終わる。サーバー側はこれを、ナビゲーション用の短い指示(「黒い傘」など)と最大8枚の参照画像の特徴量に変えて保存する。一度登録すれば、次からは一覧から選ぶだけでよい。

探索では役割を4つのエージェントに分けた。ナビゲーション役(Uni-NaVid)が「止まる」と3回続けて判断すると、その地点は「候補」になる。検証役が候補の画像を参照画像と照合し、類似度が0.6以上なら合格とする。不合格や判定保留なら、調整役が決められた動作でロボットの向きを変え、探索をやり直す。利用者に見える状態は「探索中」「見つけた」「停止」「探索失敗」の4つだけで、「見つけた」は照合に通ったときにしか出ない。

評価は実機で行った。寝室、居間、浴室、台所、玄関、庭を含む住宅環境で10個の対象物を各2回、計20試行。対象によっては同じ種類の紛らわしい物を0〜2個置いた。制限時間は600秒だ。

方式試行成功別の物で終了(誤成功)時間切れ
最初に止まった候補で終える方式205(25.0%)15(75.0%)0
RoboFind2017(85.0%)1(5.0%)2(10.0%)

比較対象の「最初の候補で終える方式」は別に走らせたものではない。同じ20回の記録を、最初の候補の時点で打ち切ったものとして再構成している。紛らわしい物をわざと置いた条件での数字であり、家庭一般で「4回に3回間違える」という意味ではない。このほか、GPT-6 Astra だけでナビゲーションする方式を6対象×2回の12試行で別に実行し、その6対象では RoboFind 10/12、GPT-6 Astra 単独 5/12、最初の候補で終える方式 4/12 だった。

代償は時間だ。成功した17回の平均は225.5秒(中央値165.8秒)で、平均で2.4個の候補を確かめ、1.5回やり直している。照合そのものは1回あたり1.9秒ほどで、所要時間の6割強は、候補を退けた後の向き直しと再探索などに充てられている。

注意したいのは、この評価に視覚障害のある参加者が加わっていない点だ。教示用の動画は既存研究「Find My Things」の撮影手順に沿って撮ったと書かれているが、誰が撮ったかは明記がない。著者自身も、利用者が情報だけを受け取るのか、自分で取りに行くのか、ロボットに任せるのかを選べる設計を今後の課題に挙げ、視覚障害のある人との共同設計とユーザー調査が「不可欠」だと書いている。

MeBo:思い出話を覚えておく音声の相手。1年分の付き合いは90分で模擬した

MeBo は、米ノースイースタン大学を中心に、MIT メディアラボとイリノイ大学アーバナ・シャンペーン校の研究者6人が2026年9月21日に公開した。

最初に言っておくと、MeBo は身体を持つロボットではない。ブラウザ上で動く音声の会話エージェントで、評価ではオンライン通話のように話しかけて使った。会話と記憶の抽出には Gemini 3 Flash、音声認識に Deepgram Nova-3、音声合成に Cartesia を使う。それでもここで取り上げるのは、コンパニオンロボットが長く付き合うために必要な「覚えていること」の設計を正面から扱っているからだ。著者も次の段階として専用ハードウェアでの検証を挙げている。

MeBo の研究の流れ。左から、11人との参加型デザイン、会話を受け持つエージェントと次の会話を準備するエージェントからなるシステム、20人による評価(SUS 87.75/100、楽しさ4.24/5、社交性4.12/5)(arXiv:2609.24706 図1、CC BY 4.0)

設計は2段階で進んだ。まず63〜78歳の11人(女性6人、男性5人)と、90分のオンライン共同設計セッションを1人ずつ行った。当初は回想を促す道具「Memory Box」として構想していたが、参加者は、話の続きを覚えていて前回の話題に戻ってきてくれる「相手」を求めた。ここから、関係性のある存在として設計する、写真や音楽を会話の糸口にする、家族や友人と共有される記憶を支える、記憶の中身を見せて本人が管理できるようにする、という4つの設計方針が導かれた。

評価は、クラウドソーシングの Prolific で集めた66〜78歳の20人(女性11人、男性9人)で行った。1人90分のオンラインセッションで、参加者は65歳の架空の人物「Alex」になりきり、初日から約1年後までを描いた8枚のシナリオカードに沿って MeBo を使う。後半のシナリオで記憶の呼び出しが働くよう、Alex の家族の情報、庭の写真、結婚式の曲といった架空の記憶を、研究チームがあらかじめ各参加者のアカウントに入れておいた。

使いやすさの標準尺度 SUS は平均87.75(SD 8.43)。前後比較では、肯定的感情(PANAS、10〜50)が39.80から42.50へ上がり、否定的感情は11.85から10.55へ下がった。その場のつながりの感覚(1〜7)は6.20から6.45に上がった。一方、孤独感の尺度(UCLA 3項目版、3〜9)は4.35から4.20で、統計的な差はなかった。

著者は限界をはっきり書いている。参加者は全員が米国在住の英語母語話者で、1回のセッションで1年を模擬することは縦断データの代わりにならない。物珍しさが薄れた後も使い続けるか、記憶の誤りが積み重なったときに信頼が保たれるかは、家庭での長期試験を待つしかない。

記憶の扱いは参加者自身も気にしていた。共同設計の段階で、ある参加者は「オンラインのAIにつながっていない限りは」と条件をつけ、個人の記憶についてはデータのことをよく考えると話している。実際の MeBo は、記憶をデータベースに書き込んだうえでバックアップとしてクラウドにも同期し、会話にはクラウドの言語モデルを使う。論文は、利用者の死後に記憶を誰が受け継ぐか、サービスが終わったら記憶はどうなるかという問いを挙げ、記憶の記録を特定のモデルやサービスから切り離し、書き出しや移行ができるようにすることを提案している。

ロボットペットを、家族の気配を運ぶ「媒体」として考える

Beyond Companionship は、ドイツ・ジーゲン大学の研究者5人による論文だ。v1 は2025年12月、改訂版の v2 が2026年9月20日に公開された。本文には、2023年の第9回 International Conference on Infrastructures in Healthcare で発表した論文の改訂版だと明記されている。新しい聞き取りは加えていない。

これまでの研究は、パロのようなペット型ロボットを、高齢者本人が向き合う「相手」として調べてきた。この論文は視点を変え、ペット型ロボットを人と人のあいだに立つ媒体として考える。たとえば、離れて住む息子がペットを通して声を届けたり、前足を動かして触れるような仕草を送ったりする使い方だ。

調査はドイツの63〜77歳の6人(男性5人、女性1人)への半構造化インタビューで、Zoom で1人40〜90分。参加者は高齢化と技術に関心のあるオンラインフォーラムで集めた。ここが肝心だが、実際に動くロボットは使っていない。答えはすべて想像上の利用についてのものだ。

参加者からは、家族がペットを遠隔で動かしてくれたら「家族にそっと触れられている」と感じられる、という声や、息子が声を送ってくれるならペットが息子のように思えてくる、という声が出た。一方で、受け入れる条件もはっきりしていた。手入れしやすく清潔に保てること、使い方がやさしいこと、声や動きを調整できること、そして人が主導権を持てることだ。

著者はここから、遠隔で誰かが動かしているのか、録音済みのメッセージか、ロボットが自分で動いているのかを、受け手が区別できるようにすべきだと論じる。家族からの操作は愛情表現にもなるが、見守りや詮索にもなりうるからで、参加者の好意的な声だけではこの問題は解けないとも書く。そのうえで、この研究は設計上の仮説を示すもので、孤独感や抑うつ、家族関係への効果を確かめたものではないと断っている。

失敗したロボットはいつ尋ねるべきか:自信ではなく、測った正答率で決める

When Should a Failing Robot Ask? は、Centific の研究者2人による論文で、2026年9月18日に公開された。第1著者は現在イリノイ大学アーバナ・シャンペーン校に所属し、研究は Centific 在籍中に行ったとある。arXiv の注記では IROS 2026 の人とロボットの対話に関するワークショップに採択されている。

問いはこうだ。物をつかみ損ねたロボットは、自分の診断を信じて直すのか、別のセンサーを見るのか、作業を止めて人に尋ねるのか。人に尋ねれば人の手間と時間がかかり、的外れな修正をすればやり直しが増える。

シミュレーター LIBERO 上の3種類の失敗。上から、持ち上げ中に物が滑り落ちる把持失敗、対象物が遮られるなどして見つからない検出失敗、容器が閉じている・満杯・遠すぎるなどで置けない配置失敗(arXiv:2609.21942 Fig. 4、CC BY 4.0)

実験はすべてシミュレーションだ。LIBERO 上の7自由度アームで物を運ぶ作業に、原因がわかっている失敗をわざと起こす。握力を弱める、物を重くする、表面を滑りやすくする、といった具合だ。失敗の種類ごとに2,200エピソードを作り、原因がどのセンサーから読み取れるかを確かめた。

結果ははっきり分かれた。見つからないという失敗は、カメラ映像から0.910の精度で原因を当てられる。滑り落ちる失敗は、手首の力覚センサーとグリッパーのデータなら0.986で当てられるのに、映像からは工夫を重ねても0.55前後で頭打ちになった。

そのうえで、7B〜16Bの公開視覚言語モデル(VLM)6つに映像だけで診断させると、どのモデルも「最も多い原因を常に答える」だけの水準を超えられなかった。回答の選択肢で「判断できない」を最後から最初に移すと、3つの組み合わせで「判断できない」と答える割合が78〜100%から0〜6%に落ちた。モデルは証拠よりも、プロンプトの並び方に反応していたことになる。表明した自信度と正誤にも関係はなかった。力覚データを10行ほどのテキストで渡すと、6つ中4つで初めて基準を上回った。

人に尋ねる価値も測っている。ただし答える「人」は台本で、80%の確率で正しい原因を、15%で役に立たない返事を、5%で誤った原因を返す。尋ねたときの正答率は0.70〜0.81で、答え手の信頼度をほぼそのまま受け取った形になった。一方で、質問のコストを1〜10の4段階で変えても、尋ねる頻度はコストに見合って動かなかった。著者の結論は、尋ねるかどうかはモデルの自信ではなく、事前に測った正答率と明示したコストで決めるべきだというものだ。

限界も書かれている。テストは失敗の種類ごとに35〜36エピソードと少ない。画像で原因がわからない結果の一部は、描画されない物理パラメーター(握力や質量)を原因に選んだ設計から来ている。実機で同じ監査をやり直すことを、最初に行うべき検証に挙げている。

4本に共通するのは、「確かめる手順」を仕組みの側に置くこと

RoboFind は、止まった地点を答えにせず候補として照合する。MeBo は、覚えた内容を本人がダッシュボードで見て、直し、消せるようにする。ロボットペットの研究は、動きの送り主を受け手が見分けられることを求める。失敗時の対話の研究は、尋ねるかどうかを測った数字で決める。どれも、ロボットの判断を人がそのまま信じなくて済むように、確かめる手順を仕組みの中に組み込もうとしている。

評価の規模はまだ小さい。実機は20試行、ユーザー評価は20人の1回きり、聞き取りは6人、残る1本はシミュレーションだ。どの論文も、長期の家庭での利用や当事者を交えた検証を次の段階に置いている。

HuRoC 視点:「見つけました」と言えるまでの距離

暮らしの隣に置くロボットでは、「できる」ことと、その報告を「信じられる」ことが別の問題になる。RoboFind の数字はそれをよく表している。候補の照合を入れただけで、別の物を答えにして終わる割合が75%から5%に下がった。代わりに1回の探索は平均4分近くかかる。家の中でこの待ち時間をどう受け止めるかは、実際に使う人と試さないとわからない。

国内でも、カシオの Moflin は保健室で来室人数や滞在時間を測る検証を始め、ユカイ工学の甘噛みハムハムは触れ合いに役割を絞って7万匹を売った。Enactic の介護助手ロボット Ena は、遠隔操作のデモとともに周辺業務から介護の現場へ入ろうとしている。ロボットが迷ったときに遠隔の人が引き継ぐ設計は、1X の NEO の「Expert Mode」にも通じる。失敗時の対話の論文は、そのとき「いつ人を呼ぶか」を数字で決める考え方を示した。

家族の気配をペットの前足に託すという発想は、2023年の最初の発表以来、この論文の範囲では試作機で確かめられていない。触れると反応する小さなロボットがすでに家庭に届いている日本なら、既存の製品に「誰が動かしているか」を示す仕組みを足すところから試せるかもしれない。


出典