『意識』について #5

バーチャルヒューマンラボ副所長の手記を複数回に渡り公開中です。できるだけ人間に近い処理をするシステムを作り、社会の役に立てたい、そのためにどうすればいいかを考察した記録です。

3,注意的機能

・「意識する」「意識しない」という言葉で表現される機能

・認知心理学や神経科学の研究で提案された数々の注意のモデルから機能面を考える
多重資源理論、バイアス競合理論、注意ネットワーク理論、一貫性理論の影響度高め

・注意には3つの特性がある
(1) 分割的(Divided)≒制限的(Limited) 複数の情報を同時に処理できるが、処理数に限界がある
(2) 選択的(Selective) 複数の情報の中から特定の情報を選ぶことができる
(3) 集中的(Focused) 特定の情報を検出することができる (=関連しない情報を除外・無視することができる?)

研究モデルと臨床モデルの両方に共通する注意

集中的注意(Focused Attention)、選択的注意(Selective Attention)、分割的注意(Divided Attention)はこれまでの注意の研究や臨床における発見から提案・報告された様々な注意の特性で共通している部分である。その他の注意は、これらの組み合わせで実現されているのではないだろうか。

・選択的注意と集中的注意の組み合わせで実現?

-空間的注意(Spatial Attention) 空間上の特定の位置に向ける
-方向的注意(Directed Attention) 空間の特定の方向の刺激に反応する

・3つの注意の組み合わせで実現?
-持続的注意(Sustained Attention) 継続的・反復的な刺激・課題に対して一貫した反応を維持する
-転換的注意(Alternating Attention) 2つ以上の異なる課題を切り替えながら対処する

全ての注意処理は共通の注意リソースを消費する

タスクの切り替えや、注意の解除、注意対象の消失などでリソースは回復する (注意リソース = ワーキングメモリ?)
注意リソースも一時的に作られる潜在空間かもしれない

言語の処理速度の限界

音声言語は音なので、解釈(伝達)に時間がかかるのはわかるが、文字言語は画像なので、1ページ分くらい一度に処理できてもいいような気がするのに、音声言語の処理速度とそこまで変わらないのはなぜなのか。

音声だろうが文字だろうが言語の時点で文法や文脈を理解するために、文章全体の単語の関係性や、前提条件などを加味した情報処理(Transformerの注意機構のような処理)が必要になって、そこでメモリを占有してるのかも? つまり、言語処理は非常に多くのメモリを使ってる?

画像から文字認識をするところで食ってる可能性もあるが、どんな言語でも伝達速度があまり変わらないのでやはりメモリ限界か。


https://www.science.org/content/article/human-speech-may-have-universal-transmission-rate-39-bits-second


このような文脈など全体の情報を処理するために一時的にメモリを使うことも注意の機能だとすると、注意と理解はほとんど同じ機能というか切り離せない1つの処理なのかもしれない。

複数の情報の中から対処すべき重要な情報を選択する

選択はボトムアップとトップダウンの2つの処理が競合的に動作する

-ボトムアップ処理 知覚プロセス中またはその直前に選択される

-トップダウン処理 認知プロセス中または意思決定後に選択される

ボトムアップ注意とトップダウン注意の競合

注意度(注意の選択の強さ)のような値を計算していて、注意リソースに空きがないときは、注意度が高い方が場所を取れる、弱ければ弾かれるようなイメージ。(選択対象の注意度が高ければ、既に注意リソースを使っている他の対象を強制的に解除する)

そのため、トップダウンで選択された注意対象より、ボトムアップで選択対象の注意度が高ければ、注意が維持され、逆であれば、注意が外れる(気が散る)ということが起こる。また、ボトムアップで選択された注意対象を、トップダウンで他の対象を詰め込むことで押しのける(気にしない)こともできる。

注意度をどのように計算するか

ボトムアップなら知覚プロセスで得た意味的情報と量的情報を基に計算?
ボトムアップはいわゆる強い刺激に対して発生しがち (派手な動き、大きな音、強烈な匂いなど)

トップダウンなら意思決定に使われた刺激とその関連度を基に計算?
目標設定ができれば、それに関連する刺激かどうかで計算できそうでもある。

計算方法がトップダウンとボトムアップで違うような気がする。
もしくは、世界モデル(生成モデル?)ような処理をしているかもしれない。

現象的意識を生成するときに、次のフレームの状態を予測して、それを知覚情報まで分解しておく。
次のフレームの知覚処理で予測が間違っていたときに、違っている部分がボトムアップの注意対象になり、間違いが大きいほど注意度が高くなる。 (注意度≒驚き度)

ただ、これだと常にビクビクしてる感じになりそうでもある・・・

特定のパターンの情報を検出する

通常モードと検出モード(除外モード)の2つのモードがあり、検出モードに切り替えることで特定の情報を検出する状態を作る

-通常モード 検出する情報が設定されていないデフォルトの状態

-検出モード(除外モード) 特定のパターンの情報が設定されており、関連度などを計算して関連性の低い情報を除外する

-指定する情報のパターンにより、様々な状態を実現する

飛んでくるボールに素早く反応するなどの「集中」
危険度の高そうな情報を検出する「警戒」
空間上の特定の場所の変化を検出する「注視」
名前を呼ばれるまで待つ「待機」 など

カクテルパーティ効果 (Cocktail-Party Effect)

音源 (音の発生源)が複数ある場合でも任意の音源だけを聞くことができる現象。

見えないゴリラ (The Invisible Gorilla)

白シャツのグループと黒シャツのグループがバスケットボールを回してる映像を見て白シャツグループのパスの回数を回答する実験。映像の途中でゴリラの着ぐるみが通過するが、50%の被験者がゴリラの存在に気づかなかった。

体験履歴のようなデータがある?

会話中に話がそれて何の話だっけとなることがある。言語処理がメモリを大量に消費するし、前の話題の注意対象が上書きされてると思われる。しかし、がんばれば元の話題を思い出して戻ることができる、これは何なのか。注意では説明できないような。

長期記憶とも短期記憶とも違う記録か何かがある?

現象的意識がエピソード記憶の基だとすると、それを体験履歴のような感じで一定期間分保存しており、それにアクセスして、ワーキングメモリに展開するような処理ができるようになっている?


「意識」について #6はこちら



We Are Hiring!

クーガーは自律的で大胆なチャレンジを支援し、それぞれの個性を生かした技術と創造性の追求ができる場を目指しています。

ぜひ採用ページからエントリーください。カジュアル面談も実施しています!


最新情報をメールで取得

登録

© Couger Inc. All rights reserved.