情報理論に基づく語性(wordhood)の
新しい類型論に向けた試論

南琉球宮古語伊良部島方言の談話データを使ったケーススタディー

An information-theoretic approach to the typology of wordhood: a case study of Irabu Ryukyuan

下地 理則(Michinori Shimoji)
九州大学 smz@kyudai.jp

言語変化・変異研究ユニット 第16回ワークショップ(東北大学)· 2026年10月4日

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

実験手順・統計・計算法の詳細は論文 PDF 版を参照

実験手法、統計上の細かい情報、数式などの詳細は、
すべて詳細版 PDF に記載しています。

本発表では要点と図だけを示します。

詳細版 PDF(Academia.edu)

Shimoji — An information-theoretic approach to the typology of wordhood: a case study of Irabu Ryukyuan

https://www.academia.edu/176379288/An_information_theoretic_approach_to_the_typology_of_wordhood_a_case_study_of_Irabu_Ryukyuan

2 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

1

問題:「語」は定義できるか

1 問題 · 3 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

まず問い:「語」を定義してみる

問 1 — 日本語

次のうち、「語」はどれか

子供

子供たち

子供たちの

子供たちのおもちゃ

たち

の

その

問 2 — 英語と日本語

英語の of と日本語の「の」は、
どちらも「語」と言えるか

of

our

children

子供たち

の

違いは、空白で区切って書くかどうかだけか?

言語学者なら、なんとなく、どれが「語」かについて答えを持っている。
問題はその答えを導いた「語の定義」の仕方。

1 問題 · 4 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

1 問題 · 5 / 35

語らしさを先に決めてから、基準を探す出来レース

⓪

語が何か、先に想定がある:「子供」は語、たち・の は付属、複合語は 1 語、「その」も語にしたい → これに合う基準を探す

①

最小自由形式

単独で言えるものが語

[その] [子供] たち の

✓ 期待どおり:「その」「子供」が語、
たち・の は付属

②

同じ基準を複合語へ

鶏 も 肉 も単独で言える

[鶏] [肉] → 鶏肉 は 2 語?

✗ 困る:複合語は 1 語にしたい
→ 基準を足す

③

割り込み可能性

間に何か入れられれば別の語

鶏×肉 → 1 語 ✓
でも 鶏 もも 肉 → 割り込めた?

「もも肉は head–dependent 構造。
割り込みではない」と言いたくなる

④

割り込み可能性は使えない

語を先に決めないと判定できない

[鶏 [もも 肉]] か 鶏 + もも + 肉 か
— 「もも」が語かを先に決める必要

✗ 循環:語の定義に interruptability は
使えない → まだ形態的基準で粘る

⑤

固定順序

語内は要素の順序が固定

鶏–肉(*肉–鶏)→ 順序は固定 → 1 語 ✓
でも 鶏もも肉・鶏もも生肉・鶏塩もも肉 → 鶏(1)–肉(2) のテンプレートは?

✗ 順序は守られても「鶏–肉」の固定テンプレートが
成り立つか疑問 → 形態的基準を諦め、音韻基準へ

⑥

アクセント(音韻基準へ)

1 つのアクセント句 = 1 語

その(平板) | 子供*たちの(3 モーラ目)
→ [その] [子供たちの]

✗ 「子供たちの」が 1 語になる
— 出発点「子供が語」と合わない

基準を替えるたびに答えが変わり、どれを語にしたいかが基準の選び方を決めている — 語を前提にしない共通の物差しが要る

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

問題:診断の循環(diagnostic cycle)

① 「語」は普遍的と仮定 grammatical / phonological word ② 合うテストだけ採用 合わないテストは軽視 ③ 期待どおりの語が記述される 記述文法 ④ 「語の証拠」として引用 通言語的妥当性の主張 反証不可能

METHODOLOGICAL OPPORTUNISM

基準を選べるから、仮定した語が必ず見つかる

Croft 2001; Haspelmath 2011

“…does not rise above the level of tautology because no one has formulated how it could possibly be refuted.”

— Tallman (2020: 9)

1 問題 · 6 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

2

提案:語を先に仮定して探す、
をやめる

2 提案 · 7 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

2 提案 · 8 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

提案:語を先に仮定して探す、をやめる

優位スパン(privileged span)

形態素〜節の構造体の中で、構造的結束性という意味で不連続に際立つ特殊な構造体はあるか?

結びつきの強さ 強 弱 崖(不連続)= 際立ち 優位スパン(手前まで強い) - - 段階的な弱化:際立ちなし — 急落(崖):際立ち 形態素レベル 節レベル 接合点 → (模式図:結果1で「情報の崖」として検定)

RQ1 — 言語内の問い(記述言語学)

共通尺度の下で、相対的優位を示すスパンはあるか

→ 本発表:伊良部語

→

RQ2 — 言語間の問い(類型論)

優位スパンは類似した構造体に集中するか

→ おわりに で英語との比較のパイロットスタディーを述べる

↓

優位スパンの構造は言語間で大きく揺れる?言語間で狭い範囲に偏る?一般化不可能?全て有意義なデータ。
優位スパンが狭い範囲(root-affixなどの構造体; Haspelmath 2023)に偏ることがわかった時、「語」なる概念が有効になる。

基準同士は比べられない → 共通尺度で候補を相互比較

既存:診断バッテリー(diagnostic battery)

候補 A 最小自由形式 その 子供 たち の 単独で言えるか → ○/× 候補 B アクセント その 子供 たち の 1 アクセント句か → ○/× 候補 C 割り込み可能性 鶏 もも 肉 間に何か入るか → ○/× 候補 D 固定順序 鶏 もも 肉 順序が固定か → ○/×

基準ごとに答えは ○/×:基準同士を比べる目盛りがない
→ 採る基準は基準の外で決まる = 選択に恣意性が残る

提案:共通尺度で候補を相互比較

A〜D を同じ規則で採点 境界 S − 内部 S / 長さを合わせたランダム基準との差 ランダム基準 優位 大 A? B? C? D? 順位は測るまで決まらない (模式図)

2 提案 · 9 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

共通尺度の3条件 — なぜ情報理論か

条件 1

領域横断の共約可能性

cross-domain commensurability

大きさの異なる候補スパンを、同じ規則で比較できる

条件 2

言語間比較可能性

cross-linguistic comparability

同じ比較を他言語へ適用する
条件を明示できる

条件 3

解釈可能性

interpretability

値が形態素間の結びつきの強さ(tightness)に結びつく根拠がある

Harris 1955 → Jin & Tanaka-Ishii 2006

予測しにくさ(分岐エントロピー) 境界 境界 abcdefgh

跳ね上がる場所が切れ目

※ 既存の分かち書きを正解として一致率を主張

Mansfield 2021

複合動詞 要素 A 要素 B A を知ると B の不確実性が減る(ビット) 内部予測可能性 低 高 = 語らしい特性

予測可能性が高いほど結合度が強い

※ 文法基準の語らしさを前提に整合性を主張

Pankratz et al. 2024

単位単位 a b c d TP 高 TP 高 TP 低 学習実験:両方の手がかりが単位形成を促す 一致したとき学習が最良

内部は高 TP、境界は低 TP

※ 単位を人工言語に作り込んで有効性を主張

2 提案 · 10 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

tightness の「不連続」が特権的地位をつくる

結びつきの強さ(tightness) 強 弱 不連続 affix と clitic の差: 勾配でも不連続でも見える root–affix host–clitic ? 他の境界 節間 接合点:形態素レベル → 節レベル - - 段階的な弱化 — 急激な弱化 Figure 3 に基づく模式図

勾配だけなら

construction / constituency の連続的な違いにすぎない

不連続があれば

その位置のスパンに特権的地位(privileged span)

問い:tightness の不連続(Tallman 2020)

→

内部不変性 / 可動性

→

予測しやすい / しにくい

→

サプライザル S で測る

2 提案 · 11 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

伊良部語:4つの候補括弧化

候補内部接語 =nu (NOM)外部接語 =i (CNF)
MWord[imsja] [=nu][imsja] [=i]
ExtWord[imsja=nu][imsja=i]
PWord[imsja=nu][imsja] =i
clause節全体節全体
フット(im)(sjanu)(imsja) i *(im)(sjai)

例:imsja「漁師」(Shimoji 2013: 69, 73, 75)

候補は記述文法から

情報理論とは独立に
記述的観点で事前に定義されている
(Shimoji 2013, 2017)

PWord vs ExtWord

違いは外部接語
(=ju, =ca, =i)の扱いだけ

2 提案 · 12 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

共通尺度:遷移サプライザル(transitional surprisal)

次が狭い:a-tar → =ca a -tar COPPST =ca HS「〜そうだ」 7 / 18 ……… 残り 11 例は分散 P ≈ .39 S ≈ 1.4 ビット 次が開く:banti=ga → jaa banti =ga 1PL.EXCLGEN jaa 「家」 ……………… 語彙名詞:開放クラス P 小 S ≈ 7.9 ビット 論文 §5.2, Figure 4(保留採点)

S = −log₂ P(次 | 前2つ)

次の形態素を予測するコスト(ビット)

文法要素の継続は予測しやすい、
語彙語根の入口は予測しにくい

2 提案 · 13 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

3

手法:伊良部語コーパスと
確率モデル

3 手法 · 14 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

予測:ExtWord が「高い境界・低い内部」を最もよく分ける

予測どおりの使用:root に affix・clitic がよく続く → ExtWord が高低を分ける 高低 root-affix=clitic root=clitic root-affix=clitic 極端な使用:root ばかり → 候補の差が消える(MWord = PWord = ExtWord) 高低 rootrootrootrootrootroot

構造からの予測

接尾辞型の言語なら、Root-Affix-Clitic単位で下り坂になりそう

ただし、構造だけでは決まらない

テンプレートは可能なまとまりを指定するだけ。優位は使用(usage)で決まる

  • root だけの使用ばかりか、affix・clitic がよく出るか
  • どの組合せがどれだけの頻度で、どの文脈で現れるか

→ 予測は条件付き。コーパスで検証するしかない

3 予測 · 15 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

方法:コーパスと確率モデル

① コーパス

形態素列(9,835 トークン)

→

② 機械学習

トライグラム言語モデルを訓練

→

③ 確率

各接合点で P(次 | 前2つ) を推定

→

④ サプライザル

S = −log₂ P を全接合点に付与

9,835

形態素トークン
(語り・会話、9録音)

4,290

ExtWord

1,710

節

ffa -gama =nu u -tar =ca childDIMNOMexistPSTHS 文脈:直前の 2 形態素 次 P( u | -gama, =nu ) → S = −log₂ P 窓をずらして、全接合点で S を推定 例 (2)「小さい子がいたそうだ」

方法の詳細は PDF

詳細版 PDF(Academia.edu)

推定手続き・平滑化・感度分析・数式は §5

3 方法 · 16 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

4

結果1:ExtWord 境界に「情報の崖」

4 結果1 · 17 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

何を測るか ①:列に沿って見る(シンタグマティック)

S 低 S 低 S 高 S 低 S 低 ffachildroot -gamaDIM-affix =nuNOM=clitic uexistroot -tarPST-affix =caHS=clitic 赤の括弧 = ExtWord(模式図:棒の高さは期待)

結果 1 で見るもの

列に沿って進み、どの接合点で S が跳ねるか

接合点タイプごとに集計

affix / clitic / ExtWord / 節 → 上昇は段階的か、崖か

4 結果1 · 18 / 35 例 (2) ffa-gama=nu u-tar=ca「小さい子がいたそうだ」

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

結果1:ExtWord 境界でサプライザルが最も高い

0 5 10 中央値 S(ビット) 2.70 5.05 11.42 10.16 affix clitic ExtWord clause 保留採点の中央値、n = 8829(Table 2)

ExtWord − clitic

6.37

ビット [6.05, 6.65]

5.14内部接語の前11.42ExtWord 境界3.63外部接語の前 ffa-gama=nuu-tar=cachildDIMNOMexistPSTHS ExtWordPWord=ca は外MWord 中央値 S(ビット)

4 結果1 · 19 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

結果1:上昇は隣接する増分より大きい — 「情報の崖」

affix clitic ExtWord clause Δ₁ Δ₂ 崖 Δ₃ 下降 - - 単調増加なら  — 観測中央値(Figure 10)

Δ₂ − Δ₁

4.02

[3.29, 4.63]

Δ₂ − Δ₃

7.62

[6.24, 9.26]

Bonferroni 調整区間、50000 録音ブートストラップ(Table 3)

- - もし単調増加なら

結びつきは段階的に弱まるだけ → construction/constituency の連続的な違い。特権的な位置はない

— 崖なら(観測)

上昇が ExtWord 境界に集中 = 不連続 → その位置のスパン(ExtWord)に特権的地位

4 結果1 · 20 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

句の内部でも ExtWord 境界で上昇、句末の追加上昇は不明

項(Arg) jaa=nu cibi「家の後ろ」 C 4.13 A 11.62 B 11.34* +7.28 jaa =nu cibi=格… 家GEN後ろCASE ExtWordExtWord[       句       ] C:ホスト→接語(内部) A:句中の ExtWord 境界 B:句の外側の端(格接語の後)格接語のある例のみ*71 ペア、同ペアの A は 11.17 述語(Pred) bassi-i njaa-n「忘れてしまった」 C 0.85 A 5.89 +4.67 bassi -i njaa -n C:語根→接辞(内部) A:連用形→助動詞 単位:中央値 S(ビット)

句中 A:内部基準 C から上昇

句末 B − A:決定不能

+0.46 [−2.22, +3.01]

4 結果1 · 21 / 35 Table 4

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

5

結果2:候補の相互比較で
ExtWord が最大の超過コントラスト

5 結果2 · 22 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

何を測るか ②:切り方を比べる(パラディグマティック)

ffachild -gamaDIM =nuNOM uexist -tarPST =caHS S(実測) 11.6 5.5 3.7 6.7 2.9 0.8 境界内部傾き = 平均の差= D(境界 − 内部) MWord D = 1.50 PWord D = 2.33 ExtWord D = 5.89 clause 境界なし 境界に数える接合点の S内部に数える接合点の S枠 = その切り方のカッコ(左端の赤=境界、中の青=内部);clause は点線(切れ目なし)

同じ列、同じ S

変わるのは境界/内部の振り分けだけ

境界ごと

d = 境界の S − 内部の S

候補ごと

D = d のコーパス全平均

偶然との差

E = D − ランダム再括弧化の D

5 結果2 · 23 / 35 例 (2) ffa-gama=nu u-tar=ca「小さい子がいたそうだ」 S は保留録音(LORO)採点の実測値(ビット)

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

構造だけではわからない。テキストの実証比較が重要

例 (2):ExtWord が優位 ffa-gama=nu u-tar=ca「小さい子がいたそうだ」 11.6 ffachild 5.5 -gamaDIM 3.7 =nuNOM 6.7 uexist 2.9 -tarPST 0.8 =caHS S(実測、各形態素の入口) D = 境界平均 − 内部平均 MWord 1.50 PWord 2.33 ExtWord 5.89
同じ構造でも:MWord が優位 osimai=du a-tar=saai「おしまいだったよ」 25.4 osimaiおしまい 6.8 =duFOC 5.3 aCOP 0.8 -tarPST 23.1 =saaiADR S(実測、各形態素の入口) D = 境界平均 − 内部平均 MWord 14.34 PWord 5.11 ExtWord 5.11

同じ「名詞=接語 動詞-接辞=接語」でも、=saai の入口が 23.1 ビットと予測しにくい右の例では MWord が勝つ。
どの候補が優位かは構造ではなく使用(テキスト)が決める → 一発話ではなくコーパス全体で、偶然の括弧化(E)と比べて検定する

5 結果2 · 24 / 35 S は保留録音(LORO)採点の実測値(ビット);右の例は録音 1(namihira)、発話 3

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

結果2:ExtWord が最大の超過コントラスト

0 4 8 ビット MWord 5.03 PWord 7.11 ExtWord 7.64 clause 2.03

ExtWord − PWord(調整区間)

0.53

ビット [0.26, 0.87]

順序はどの感度分析でも不変

5 結果2 · 25 / 35 超過 E と 95% 録音ブートストラップ区間(Table 5)

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

拡張:句中の切れ目 A を消して併合すると E は変わるか

属格 jaa=nu cibi「家の後ろ」 ExtWord jaa =nu cibi A = 境界 家GEN後ろ 併合 jaa =nu cibi A = 内部 併合 − ExtWord −0.47 [−1.03, −0.10] E 低下 連用形–助動詞 bassi-i njaa-n「忘れてしまった」 ExtWord bassi -i njaa -n 忘れるSEQPRFNPST 併合 A = 内部 併合 − ExtWord +0.10 [+0.01, +0.25] E 上昇

名詞は併合すると悪化、
述語複合体は改善

広範な ExtWord 優位と局所的統合は共存(文法化?)

5 結果2 · 26 / 35 全形、Bonferroni 調整(§7.5)

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

小括:伊良部語では ExtWord が privileged span

結果 1 シンタグマティック

11.4 ビット

ExtWord 境界の S が最大。上昇は隣接する増分を上回る「崖」

結果 2 パラディグマティック

E = 7.64 ビット

4候補中で最大の超過コントラスト。PWord との差 0.53 [0.26, 0.87]

句との関係

局所

句中でも ExtWord 境界で上昇。句末の追加上昇は不明。SEQ–AUX 併合だけが改善

RQ1:記述された4候補の中で、ExtWord に相対的優位

小括 · 27 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

6

独立検証:ポーズ分析

サプライザルとは無関係の尺度で、
同じまとまりが支持されるか

6 ポーズ検証 · 28 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

独立検証:ポーズは ExtWord のまとまりに対応するか

(a) 同じ ExtWord 境界・同じ長さ 棄却 461 ms エネルギー比 0.70 tii QUOT du FOC az say ta PST (b) 同じ ExtWord 境界・同じ長さ 検証済みポーズ 461 ms エネルギー比 0.12 kari 3SG ga NOM kanu that 灰:波形 黒:10 ms RMS 包絡 網掛け:形態素間の間隔(論文 Figure 8)

検証済みポーズ(verified pause)

間隔 ≥ 200 ms
かつ エネルギー比 < .3(前形態素比)

長さだけでは決まらない。無音の音響的証拠が必要

サプライザルとは独立のパフォーマンス尺度

語内ポーズは遍在する → 有無ではなく率で比較

アラインメント:MMS 強制アラインメント(Pratap et al. 2024)、8995 形態素

6 ポーズ検証 · 29 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

ExtWord の端では節並みにポーズ、内部ではほぼ無し

ExtWord 内部(affix・clitic)

0.27%

13 / 4734

ExtWord の端(非節)

10.9%

259 / 2379

節境界

10.8%

51 / 472

外部接語(0.6%)も内部接語(0.3%)も、ポーズの上ではスパンの内側

6 ポーズ検証 · 30 / 35 検証済みポーズの率(§8.3, Table 6)

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

7

おわりに

7 おわりに · 31 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

我々は「情報理論的な語」を定義したのではない

従来:診断による語の類型論

本研究:共通尺度による候補の比較

「語」の位置

前提:語はあるとして、それを切り出す

検定対象:際立つスパンがあるかを問う。語と呼ぶかは 現段階の範囲外。それはRQ2 の後

尺度

基準ごとに ○/×。基準同士の優劣を比較できない。
よって、どの基準を採るかは基準の外で決まる(診断の循環)

候補は記述文法で先に固定、尺度は一本(S)。情報理論は語の新しい診断ではなく、
候補を比べる物差し

通言語的比較

言語ごとに別の基準で「語」を定義 → 「みんな違って、みんな語」。言語間に比較の物差しがない

RQ2 として独立に実施。RQ1 と同じ共通尺度で、優位スパンの位置と強さを言語間で比較できる

見つけたのは新しい種類の語ではない。
独立に定義された候補(言語個別的な記述の中での様々な「語」を含む)の間で、どれが相対的に優位だったか。

7 おわりに · 32 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

優位は層状の境界と使用の上に成り立つ

root-affix=clitic root-affix=clitic affix 2.7 clitic 5.1 ExtWord 11.4 境界の強さは層状(中央値 S、ビット) 特権的スパンは、境界に情報的対比を持つ小さな単位を含みうる

ExtWord の優位は内部の差異(affix < clitic)と共存する —— 境界は層状

優位は構造だけでなく
使用(頻度・文脈)に依存する

7 おわりに · 33 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

7 おわりに · 34 / 35

RQ2 へ:一言語から語の類型論へ

(a) 急落の位置が揃う 形態素節 (b) 位置がばらつく 形態素節 (c) 段階的弱化 形態素節 各曲線=一言語、縦軸=凝集(Figure 11)

英語(GUM)の探索例:名詞句 P Art N-Infl

共通の動機

内部が予測しやすく端が予測しにくい列は、単位として学習・処理される。「語」と呼ばれてきたスパンの一部はその反映

×

言語ごとの形態的制約

接尾辞型・接頭辞・複合・構文頻度がスパンの大きさと構成を決める:伊良部語は語根–接辞–接語、英語は屈折付き名詞

→

新しい語性類型論

情報量の最適化の「結果としての語」は、言語の形態構造の癖に影響され、また運用によって流動するはず。言語の形態類型とテキスト運用を重視した語性類型論が必要

of the child -ren PArtNInfl 3.499.943.15 接合点の S(ビット) E 3.14 P|Art|N-Infl 優位 E 1.98 [P Art N-Infl] E 1.01 P|[Art N-Infl] 語例は説明用

優位なのは屈折を含む名詞:Art・P から切り離した括弧化が最大の E

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

日本語への含意:文節の「特権性」を問い直す

kaeri -tai =to it -ta 帰るDESIDQUOT言うPST 「帰りたいと言った」 文節 自立語+付属語 = ExtWord に相当 最小発話性 橋本 1934 ‿ =to の前でポーズ可能→ 文節と不一致 韻律単位 上野(1989)他多数 文節より小さい/文節を分割しうる 仮説:情報理論 本研究の括弧化 S 高 低低低 ExtWord 相当の括弧化が優位? (棒は予測の模式図。日本語では未検定)

既存の根拠

最小発話性も韻律も部分的支持。何が文節を一貫して区別するかは未解決

第三の独立した問い

伊良部では文節相当の ExtWord が情報的に優位。日本語でも同じ物差しで検定できるので、やってみたい

図中の文献:橋本 (1934)『国語法要説』 上野 (1989)「日本語のアクセント」

7 おわりに · 35 / 35

イントロ

1 問題

2 提案

3 手法

4 結果1

5 結果2

小括

6 ポーズ検証

7 おわりに

· ←/→ でめくる · 全画面