インターヒューマンAIは、人間が言葉を使わずに言うことをAIに教えたいと考えている

AIは私たちの言うことを理解するのが得意になりました。しかし、人間のコミュニケーションは決して言葉だけのものではありません。私たちはためらい、自信、不確実性、関与、同意を、多くの場合、誰もあからさまに表現せずに感じ取っています。

これらの非言語的および文脈上のシグナルは、私たちがインタラクションを解釈する方法を形成しますが、その情報の多くは今日の AI システムにはほとんど見えないままです。コペンハーゲンを拠点とする Interhuman AI は、そのギャップを埋めるために取り組んでいます。

独自のモデルを構築しているヨーロッパの AI スタートアップの中でも比較的少数の 1 つである同社は、AI によるこれらのシグナルの解釈を支援するように設計されたソーシャル インテリジェンス テクノロジーを開発しています。その最新モデルである Inter-2 は、テキスト、オーディオ、ビデオにわたるソーシャル シグナルをリアルタイムで分析します。

ChatGPTからソーシャルインテリジェンスへ

共同創業者のCOOであるFrederik Sally氏とCEOのPaula Petcu氏に詳しく話を聞きました。 Petcu 氏は、Interhuman のアイデアは、ChatGPT などの LLM の主流の登場とともに浮上したと述べました。

AI は人々の AI との関わり方を変革しましたが、ボディランゲージ、声の調子、顔の表情、その他の社会的シグナルについてはほとんど盲目のままでした。当時、ペチュ氏は製薬業界で働いており、臨床試験において AI が患者をよりよく理解できる方法を模索していました。

「そこからアイデアが生まれました。大規模な言語モデルを、カメラとマイクからのビデオと音声を分析するモデルと組み合わせて、ユーザーが実際に何をコミュニケーションしているのかを理解するための別のセンシング層を追加できないか?」

Petcu 氏は、この分野を研究していた共同創設者兼 CRO の Line Clemmense 氏にウェビナーを通じて会いました。二人は最初のプロトタイプを構築しました。それは、誰かが言ったことだけでなく、その言い方に反応する AI コーチです。

その後、彼らは Antler のマッチメイキング プログラムに参加し、そこでチームに運営と製品の視点をもたらした Sally と出会いました。

「AI のユーザー エクスペリエンスは、モデルがユーザーにどのように反応するか、モデルがユーザーをどの程度理解しているかによって大きく左右されます」とサリー氏は言います。

Inter-2 は、新しいファミリーの最初のモデルです。顔の表情、声のトーン、ボディランゲージ、視線の変化、姿勢、頭のジェスチャーなどの行動の合図を分析し、関与、ためらい、不確実性、混乱、同意、意見の相違などの 12 の社会的シグナルをリアルタイムで検出します。同社によれば、Inter-2 はベンチマーク パフォーマンスの向上とともに最大 4 倍高速な推論も実現し、大規模なリアルタイム信号検出がより実用的になるという。 ​

「今日のモデルは非常に有能ですが、依然として社会的聴覚障害者です。彼らは言葉を書いた人ではなく、言葉に反応します。間違った瞬間に正しい答えが返されたとしても、それは依然として悪い答えです」とサリーは語った。 ​

人工社会知能の実現に向けた取り組み

Inter-2 は、Interhuman が人工社会知能と呼ぶものに向けた一歩であり、人間が毎日のやり取りをナビゲートするために使用する知覚能力を AI システムにさらに提供します。 Interhuman は行動科学と機械学習を組み合わせ、人々がお互いを認識し解釈する方法を AI システムが処理できる構造化信号に変換します。同社は独自のモデルを構築しています。

Petcu 氏によると、主要な AI ラボは主に一般的な知能と生産性に焦点を当てており、人間のコミュニケーションや社会的信号の検出にはあまり注目していません。

「将来の AI システムでこの層を考慮しない場合、潜在的な結果を考慮せずにワークフローと生産性を過剰に最適化するリスクがあります。」

彼女はその一例として、AI を活用した医療トリアージを挙げています。電話で AI と話しているときに誰かがイライラしたり悩んだりすると、それらの信号を感知できないシステムは状況を誤解し、救急医療に関して誤った判断を下してしまう可能性があります。ロボット工学では、人型ロボットが動作を停止する必要があることを認識できない場合、身体的危害を引き起こす可能性があります。

人間の行動を解釈する問題

しかし、人間の行動は厄介で、非常に個人的です。個人の特異性は、社会的な合図が人や状況に応じて異なるものを示す可能性があることを意味します。たとえば、沈黙やためらいは不確実性を示している可能性がありますが、それは誰かが話す前に考えていることを簡単に意味している可能性もあります。

重要なのは、Interhuman が評価を追跡できるようにモデルを設計しており、エンド ユーザーが特定の結論に至った手がかりを理解できるようにしていることです。

サリーは次のように説明しました。

「私たちは、モデルの出力の背後にある理論的根拠を含めることが重要であると考えました。特定の信号が識別された原因を追跡できる必要があります。

私たちは、評価の背後にあるものを理解できるように、モデルを可能な限り透明にするよう努めています。」

たとえば、AI 支援の面接を想像してください。その会話で何が起こったかを追跡できるはずです。

「なぜモデルは、その特定の瞬間にためらいを特定したのでしょうか。人間として、AI が私の将来について何かを決定しているのであれば、私はそれに疑問を抱きたいと思っています。」

文化、言語、年齢、神経の多様性、個人のコミュニケーション スタイルの違いを考慮することは、別の課題となります。

サリーの場合、その変動に対処するためには、十分に多様なデータを収集し、それに適切に注釈を付けることから始まります。同社は当初、問題を理解し、注釈プロセスを開発するために、公開されているデータを使用しました。

現在では、従業員がさまざまな種類の会話を記録することで独自のデータも収集し、外部のデータプロバイダーと協力してデータセットを拡張しています。 Interhuman は、心理学者や行動科学者などの専門アノテーターと協力して、モデルの開発に使用される行動データにラベルを付けます。

サリー氏は、このデータ パイプラインの構築と、資料に一貫して注釈を付けるように従業員をトレーニングすることが、会社の仕事の重要な部分を占めていると述べました。

「私たちのアプローチは行動科学文献に基づいており、最初から可能な限り厳密にしようとしています。」

AIを構築する責任

AI の機能が成長するにつれて、プライバシー、操作、人間の制御に関する問題はさらに重要になります。

「ソーシャル インテリジェンスは、人を判断したり、誰かが何を考えているかを知っていると主張したりするものであってはなりません。ソーシャル インテリジェンスは、AI に人間のコミュニケーションを理解するためのより多くのコンテキストを提供すると同時に、その情報がどのように使用されるかを人々が制御できるようにする必要があります」とペチュ氏は述べました。

インターヒューマンが自社のモデルを使用する企業がどのように責任を持って使用していることを保証しているかについて興味がありました。サリーは、それが会社で頻繁に議論されていることを認めています。

インターヒューマンは、この技術の防衛用途に興味のある投資家を断るなど、誰と協力するかについてすでにいくつかの境界線を引いている。彼は、ソーシャル インテリジェンスが悪用される可能性がある例として、AI 対応のスマート グラスを挙げています。

「これに当社のテクノロジーを追加し、現実世界を移動するときに見知らぬ人を分析するために使用することを想像してください。潜在的には、それらの洞察を使用して人々を操作したり、人々に対して優位に立ったりすることもできます。」

インターヒューマンは、より多くの企業が同社のテクノロジーを使用し始めるにつれ、欧州規制の下で特定の AI アプリケーションにすでに課されている制限に加えて、モデルの許容可能な使用を管理するより広範なルールを開発する予定です。

Petcu 氏は、同社は現在、顧客が自社のシステムをどのように使用しているかを可視化し、顧客と直接関わることができるほど十分な規模であると述べた。

「これにより、私たちは彼らのビジネスについてさらに詳しく知ることができ、EU AI法やデータプライバシーに関する質問に答えることができ、場合によっては『このテクノロジーを意図した目的には使用できない』と伝えることができます。」

Interhuman は GDPR に準拠しており、現在セキュリティ認証監査を受けています。そのプロセスの透明性は、企業やその法務部門と話すときに役立ちます。

ソーシャルインテリジェンスが活用できる場所

Interhuman は、企業がそのモデルにアクセスできるようにする API を提供するため、セクターに依存しません。たとえば、企業研修用に AI ベースのロールプレイング アプリケーションを構築している顧客がいます。それには、AI との難しい会話、給与交渉、面接の練習などが含まれるかもしれません。 AI は、誰かが何を言ったかだけでなく、どのように言ったかについてもフィードバックを提供できます。

「そうすることで、自分自身をどのように表現するかを評価することもできるので、フィードバックがより実用的になります」とサリーは言います。

同社は、デンマークの児童・青少年精神保健センターの臨床心理士らと協力し、親が子どもとより効果的にコミュニケーションをとる方法を学ぶのに役立つアプリをサポートするなど、デジタルヘルスにも取り組んでいる。

ペチュの詳細:

「たとえば、子供が学校に行きたくなくて叫んでいる場合、その状況にどう対処しますか?正しいボディーランゲージ、声のトーン、言葉を使用していることをどのように確認しますか?」

デジタルヘルスコーチングもあります。これは、共感的な AI コーチで、ユーザーがどのように発言しているかを聞き、ユーザーの発言の裏に何かがあるのではないかと潜在的に尋ねることができます。

「さらに、会議のメモ取りやセールス コーチングなど、セールス トレーニングやセールス インテリジェンスにも応用できます。」

市場調査は別の分野です。

「AI の面接官が顧客に製品の味についてどう思うかを尋ねるとします。顧客が甘いと答えた場合、AI はその反応に関連するシグナルを認識し、甘すぎるかどうかをさらに詳しく調査します。」ペチュは説明した。

同社は、将来的には、ソーシャル インテリジェンスがロボット工学、高齢者介護、AI コンパニオン、その他の物理的アプリケーションのレイヤーになると予想しています。また、アバターを人間味のあるものにすることを目指している企業とも話し合っている。彼らが取り組んでいる問題の 1 つは、アバターが話を聞いている間にどのように振る舞うべきかという単純なものだ。

「それは実際には難しい問題です。他の人が話しているときにどのように反応すべきでしょうか?企業はそのために私たちのテクノロジーを使用することについて私たちにアプローチしています」とサリーは言いました。

より複雑な会話で AI を社会的に認識させる

Interhuman はセールス トレーニング、コーチング、インテリジェンスに重点を置いていますが、セールス コールやカスタマー サポートのやりとりの多くは電話で行われています。

「これは音声のみなので、視覚的な情報はありません」とサリーは説明しました。

Interhuman は、これを処理できるモデルを開発中です。「ビデオとオーディオの両方を含む豊富なデータセットを扱うほうが明らかに簡単です」と Sally 氏は説明しました。

「声だけが聞こえると、何が起こっているのかを理解することがさらに難しくなります。」

しかし、さらに多くの音声 AI アプリケーションも可能になります。同氏は、音声が AI と対話するための次の主要なインターフェースになるだろうと予測しています。

「私たちはチャットを通じて対話することに多くの時間を費やしてきましたが、すでに開発者が AI コーディング エージェントと会話しているのを目にしています。」

今後、同社は個々の信号を改善し、ノイズの多いデータに対してモデルをより堅牢にすることに取り組んでいます。複数人が関わる会話もサポートしたいとしている。

「この 2 人の関係は何ですか? AI は人 A と人 B に対してどのようにアプローチすべきですか? 彼らはお互いについて何を知っていますか?」ペチュを共有しました。

「モデルにまだ教える必要があるニュアンスがたくさんあります。」

パワーダイナミクスも研究されているもう 1 つの領域です。就職面接は友好的な会話とは大きく異なり、同じ合図でも状況に応じて異なる意味を持ちます。インターヒューマンは10月に追加の2モデルを発表する。 ​

ヨーロッパでの AI モデルの構築

Petcu にとって、Interhuman がヨーロッパで独自の AI モデルを開発していることが重要です。

「AI ラボを設立し、社会に影響を与える可能性のある独自のモデルを開発することは、ここでは非常に珍しいことです。」

彼女は、欧州のより厳しい規制環境の中で技術を開発すれば、最終的にインターヒューマンが他の市場に拡大する際に有利になる可能性があると主張している。

「この技術をここでうまく構築し、これらの要件を満たすことができれば、他の場所でも規制要件を満たす有利な立場に立つことができると思います。」

リード画像: Interhuman AI の共同創設者: CEO の Paula Petcu、COO の Frederik Sally、CRO の Line Clemmensen。