語学・英語学習 マジカ!?ゼミ・言語学ホント

「つながる単語は近くに置く」は37言語で本当だった。でも日本語は“ゆるめ”。依存距離の研究

「つながる単語は近くに置く」は37言語で本当だった。でも日本語は“ゆるめ”。依存距離の研究

読む前に予想してみよう!

日本語のように動詞が文の最後に来る言語では、長い語句を先に言う傾向がある

研究カード(どんな研究?)
対象
37言語の構文解析済みコーパス(10語族)
規模
37言語(コーパス規模は言語により大きく異なる)
研究の種類
コーパス分析(ランダム語順との比較)
確かさ
★★★★☆
3秒でわかる

文法的につながる単語どうしの距離は、37言語すべてで「でたらめな語順」より短かった。脳の負担を減らす並べ方らしい。ただ日本語などでは短縮が控えめ。

ひとことで言うとどの言葉も、つながる単語を近くに置く傾向があった。脳をラクにするためかも!

論文スペック表研究デザイン・規模・結果・その後(玄人向け)
研究デザイン
コーパス分析(実際の語順とランダムな語順の比較)
データ
10語族37言語のツリーバンク(主に書き言葉、日本語は話し言葉の対話)
比較基準
自由語順・固定語順のランダム並べ替え(各文100通り)と最適語順
主な指標
文が長くなるにつれての依存距離の増え方
統計
文ごとのランダム効果を入れた混合効果モデルの尤度比検定
主な結果
自由語順比で37言語すべて短い。固定語順比でもテルグ語以外で短い
その後の訂正・再分析
図の取り違えと参考文献欠落の訂正。2022年に「主要部の数」で測る再評価
もくじ
  1. 問い:「近くに置く」は本当に世界共通か
  2. 方法:本物の語順 vs. でたらめな語順
  3. 結果:37言語すべてで「ランダムより短い」
  4. 日本語は“ゆるめ”?:主要部後置言語のクセ
  5. 研究史の中での位置づけ
  6. まとめ

英語の “pick up the box” と “pick the box up”。どちらも正しい英語です。

でも、箱が長くなって “pick the box that was lying on the kitchen floor up” になると、とたんに読みにくい。up がどの動詞とセットなのか、頭の中で長いあいだ“保留”しないといけないからです。

「文法的につながる単語は、なるべく近くに置く」。この素朴な原理が、実は世界の言語に共通する“普遍的な性質”なのではないか――。2015年、MITのフットレル(Futrell)らは、37言語の大量の文を使ってこの仮説を検証しました。結果は、37言語すべてで「イエス」。ただし、日本語のような言語には、ちょっと面白いクセがありました。

01問い:「近くに置く」は本当に世界共通か

なぜ近いほうがいいのか。心理言語学ではギブソン(Gibson)が1998年に、結びつく語が離れているほど、その間ずっと記憶で保持しなければならず、処理が難しくなるという局所性の理論(のちの依存局所性理論につながる考え方)を提案しています。

この考え方は、語順の世界的な傾向――たとえば「前置詞を使う言語は動詞が目的語の前に来やすい」といった、いわゆる語順の相関――を説明する原理としても使われてきました。

ただ著者らによれば、実際の文で依存距離が短くなっているかを確かめた研究は、言語数が少ないか、特定の構文だけを見たものが中心でした(この見方には、後で紹介するように異論もあります)。そこでフットレルらは、近年整ってきた多言語ツリーバンクを使い、たくさんの言語の“ありのままの文”全部で確かめることにしたのです。

02方法:本物の語順 vs. でたらめな語順

比較の“ものさし”(ベースライン)は2種類です。

  • 自由語順ベースライン:主語が動詞の前に来たり後ろに来たり、毎回でたらめに並べる。
  • 固定語順ベースライン:「主語は動詞の前」のような並べ方のルールをランダムに1つ決めて、それを一貫して適用する。現実の言語に近く、より厳しい比較になる。

さらに、線が交差しない並べ方の中で依存距離がもっとも短くなるもの(最適ベースライン)も計算し、「実際の言語はどこまで最短に近いか」も見ています。

統計では、文が長くなるにつれて依存距離がどう増えるかを、言語ごとに混合効果モデルで推定しました。本物の文の依存距離が、ランダムな文より“ゆっくり”増えるかが勝負どころです。

03結果:37言語すべてで「ランダムより短い」

  • 自由語順ベースラインと比べると、37言語すべてで、本物の文の依存距離はランダムな並べ方より短く、文が長くなるほど差が広がった。
  • より厳しい固定語順ベースラインでも、ほぼすべての言語で同じ結果。例外は、長い文がほとんど含まれない小さなコーパスだったテルグ語だけ(有意差なし)。
  • 一方で、実際の依存距離は最適ベースラインよりは長かった。言語は依存距離を「完全に最小化」しているわけではなく、他の要因とのバランスをとっていると著者らは考えている。

たとえば12語の文で比べると、イタリア語ではランダムな並べ方の平均が約27.5、実際の文が約18.0。かなりの短縮です。一方、トルコ語ではランダム約26.8に対して実際は約23.7と、差が小さめでした。

結びつく語を近くに置く並べ方(左)と、でたらめな並べ方(右)。実際の言語は左に近かった
結びつく語を近くに置く並べ方(左)と、でたらめな並べ方(右)。実際の言語は左に近かった

04日本語は“ゆるめ”?:主要部後置言語のクセ

著者らが「新しく、予想外の発見」と述べたのが、日本語・韓国語・トルコ語のような主要部後置の言語では、短縮の度合いがずっと小さいという点でした。逆に、イタリア語、インドネシア語、アイルランド語などは高度に最適化されていたといいます。

なぜか。著者らの仮説は「格標示」です。日本語には「が」「を」「に」のような助詞があり、単語が文の中で何の役割を果たすかが語の形そのものから分かる。だから結びつく語どうしが多少離れていても、どの語がどれにかかるかを見失いにくく、依存距離への圧力が弱まるのではないか――というわけです。実際、格標示のあるドイツ語では、長い依存が英語ほど処理を難しくしないという先行研究もあると著者らは指摘しています。

ただし、日本語が「依存距離を気にしない」わけではありません。山下とチャン(Yamashita & Chang)は2001年、日本語話者を対象とした2つの実験で、話し手が長い語句を文の前のほうに出す傾向(長いものが先)を示しました。

英語では「短いものが先、長いものは後ろ」が好まれます。日本語では逆。一見正反対ですが、動詞が最後に来る日本語では、長い語句を先に出して短い語句を動詞の近くに残すほうが、結びつく語どうしの距離が短くなる。つまり、どちらも「近くに置く」原理の鏡像として説明できるのです。

ここから玄人ゾーン

ここまで読めば要点はつかめています。この先は反論・方法論・未解決の問いまで踏み込みます。

05研究史の中での位置づけ

依存距離最小化は、フットレルらの論文以降、語順の普遍性を処理効率で説明する研究の柱の一つになりました。

その後、フットレルらは依存の局所性を語順の説明原理として理論的に整理し(2020年、Language誌)、フットレルも著者に加わったハーン(Hahn)らの研究は51言語のデータで「複雑さを減らす圧力」と「あいまいさを減らす圧力」の両方を最適化した文法が、語順の相関の多くを再現できることを示しています(2020年、PNAS)。

つまり、「つながる語を近くに」は単独で語順を決める万能原理ではなく、格標示、あいまいさ回避、情報の出し方の順序などと綱引きしながら働く一つの力、というのが現在の見方に近いでしょう。

06まとめ

フットレルらは37言語の大量の文を使い、文法的につながる単語どうしは、どの言語でもランダムな並べ方より近くに置かれていることを示しました。人間のワーキングメモリの限界が、語順という言語の“設計”にまで影響している可能性を示す、強い証拠です。

一方で、日本語のような主要部後置言語では短縮が控えめで、その理由はまだ仮説の段階。英語の「短いものが先」と日本語の「長いものが先」が同じ原理の鏡像だという話は、英語と日本語の両方を学ぶ人にとって、語順を見る目が変わる発見ではないでしょうか。

この研究を英語で読もう原田英語の English CornerIn every sentence, some words depend on others. 音声 4択クイズ9問A2・B1・B2タップして開く

原田英語の English Corner

この研究を英語で読もう

In every sentence, some words depend on others. A verb needs its subject and object, and an adjective belongs to a noun.

Researchers at MIT asked whether languages keep these linked words close together. They used collections of sentences in 37 languages that had already been analyzed by hand. For each sentence, the computer made 100 versions with the same grammar links but with the words in a random order.

Then the team compared the total distance between linked words. In every language, real sentences had shorter distances than the random versions. The researchers think this helps listeners, because they do not have to hold words in memory for long. Japanese, Korean and Turkish showed a smaller effect.

118 words ・ CEFR B1

和訳を見る

どの文でも、ある単語はほかの単語に依存しています。動詞には主語と目的語が必要ですし、形容詞は名詞に属しています。

MITの研究者たちは、言語がこうした結びついた単語を近くに置いているかどうかを調べました。彼らは、すでに人の手で分析された37言語の文のコレクションを使いました。コンピューターは1つの文ごとに、文法上の結びつきは同じで単語の順番だけがでたらめな版を100通り作りました。

そしてチームは、結びついた単語どうしの距離の合計を比べました。どの言語でも、本物の文のほうがでたらめな版より距離が短かったのです。研究者たちは、聞き手が単語を長く記憶にとどめておかなくてすむので、これは聞き手の助けになると考えています。日本語、韓国語、トルコ語では効果が小さめでした。

4択リーディングクイズ

Q1. What is the passage mainly about?

Q2. How many random versions did the computer make for each sentence?

Q3. Why might short distances help listeners?

重要単語

  • dependencyC1
    名詞依存関係The verb and its object form a dependency. depend on ~(~に頼る)の名詞形。日常では「依存(症)」の意味でも使う。
  • word orderB1
    名詞(句)語順Japanese word order is quite flexible. in alphabetical order「アルファベット順に」の order と同じ「順序」。
  • working memoryC1
    名詞(句)作業記憶(ワーキングメモリ)Long sentences put a load on working memory. short-term memory(短期記憶)と近いが、情報を保ちながら操作する働きを強調する用語。
  • baselineC1
    名詞比較の基準、ベースラインThey compared real sentences with a random baseline. テニスコートの「ベースライン」と同じ語。研究では「比べる基準」の意味で頻出。
  • minimizeB2
    動詞最小にするSpeakers seem to minimize the distance between related words. minimum(最小)+-ize。反対は maximize。イギリス式つづりは minimise。
  • shuffleB2
    動詞(順番を)混ぜる、シャッフルするThe computer shuffled the words a hundred times. トランプを切る shuffle と同じ。音楽の「シャッフル再生」もこの語。
  • head-finalC1
    形容詞主要部後置のJapanese is a head-final language. head(中心語)が final(最後)に来る。英語は head-initial(主要部前置)寄り。
文法的につながる単語どうしの距離を測ると、37言語すべてで「でたらめに並べた場合」より短かったらしい。言語はみんな脳の記憶の負担を減らす並べ方を選んでいる? ただ日本語や韓国語、トルコ語は“短縮ゆるめ”。

押すと「マジかリスト」に保存されます

出典・参考文献(5件)タップで表示

原典ガイド:入門から読むと入りやすく、必読は議論の土台、発展はその先の論点です。

  1. 必読Futrell, Mahowald & Gibson (2015) Large-scale evidence of dependency length minimization in 37 languages. PNASdoi.org37言語を比べた本論文。ベースラインの作り方と、言語ごとの結果
  2. 発展Gibson (1998) Linguistic complexity: locality of syntactic dependencies. Cognitiondoi.org離れた依存ほど処理が重くなるとする局所性の理論を提案した心理言語学の古典
  3. 発展Yamashita & Chang (2001) "Long before short" preference in the production of a head-final language. Cognitiondoi.org日本語話者の「長いものが先」の傾向を示した産出実験
  4. 発展Liu, Xu & Liang (2015) Dependency length minimization: Puzzles and Promises. arXivarxiv.org先行研究、コーパスのジャンル、比較基準の問題を指摘したコメント論文
  5. 発展Yadav, Mittal & Husain (2022) A Reappraisal of Dependency Length Minimization as a Linguistic Universal. Open Minddoi.org依存距離を「語の数」ではなく「主要部の数」で測り直した再評価