南琉球宮古語伊良部島方言の談話データを使ったケーススタディー
An information-theoretic approach to the typology of wordhood: a case study of Irabu Ryukyuan
下地 理則(Michinori Shimoji)
九州大学 smz@kyudai.jp
言語変化・変異研究ユニット 第16回ワークショップ(東北大学)· 2026年10月4日
実験手法、統計上の細かい情報、数式などの詳細は、
すべて詳細版 PDF に記載しています。
本発表では要点と図だけを示します。
詳細版 PDF(Academia.edu)
https://www.academia.edu/176379288/An_information_theoretic_approach_to_the_typology_of_wordhood_a_case_study_of_Irabu_Ryukyuan
2 / 35
1
1 問題 · 3 / 35
問 1 — 日本語
次のうち、「語」はどれか
子供
子供たち
子供たちの
子供たちのおもちゃ
たち
の
その
問 2 — 英語と日本語
英語の of と日本語の「の」は、
どちらも「語」と言えるか
of
our
children
子供たち
の
違いは、空白で区切って書くかどうかだけか?
言語学者なら、なんとなく、どれが「語」かについて答えを持っている。
問題はその答えを導いた「語の定義」の仕方。
1 問題 · 4 / 35
1 問題 · 5 / 35
⓪
語が何か、先に想定がある:「子供」は語、たち・の は付属、複合語は 1 語、「その」も語にしたい → これに合う基準を探す
①
最小自由形式
単独で言えるものが語
[その] [子供] たち の
✓ 期待どおり:「その」「子供」が語、
たち・の は付属
②
同じ基準を複合語へ
鶏 も 肉 も単独で言える
[鶏] [肉] → 鶏肉 は 2 語?
✗ 困る:複合語は 1 語にしたい
→ 基準を足す
③
割り込み可能性
間に何か入れられれば別の語
鶏×肉 → 1 語 ✓
でも 鶏 もも 肉 → 割り込めた?
「もも肉は head–dependent 構造。
割り込みではない」と言いたくなる
④
割り込み可能性は使えない
語を先に決めないと判定できない
[鶏 [もも 肉]] か 鶏 + もも + 肉 か
— 「もも」が語かを先に決める必要
✗ 循環:語の定義に interruptability は
使えない → まだ形態的基準で粘る
⑤
固定順序
語内は要素の順序が固定
鶏–肉(*肉–鶏)→ 順序は固定 → 1 語 ✓
でも 鶏もも肉・鶏もも生肉・鶏塩もも肉 → 鶏(1)–肉(2) のテンプレートは?
✗ 順序は守られても「鶏–肉」の固定テンプレートが
成り立つか疑問 → 形態的基準を諦め、音韻基準へ
⑥
アクセント(音韻基準へ)
1 つのアクセント句 = 1 語
その(平板) | 子供*たちの(3 モーラ目)
→ [その] [子供たちの]
✗ 「子供たちの」が 1 語になる
— 出発点「子供が語」と合わない
基準を替えるたびに答えが変わり、どれを語にしたいかが基準の選び方を決めている — 語を前提にしない共通の物差しが要る
“…does not rise above the level of tautology because no one has formulated how it could possibly be refuted.”
1 問題 · 6 / 35
2
2 提案 · 7 / 35
2 提案 · 8 / 35
優位スパン(privileged span)
形態素〜節の構造体の中で、構造的結束性という意味で不連続に際立つ特殊な構造体はあるか?
RQ1 — 言語内の問い(記述言語学)
共通尺度の下で、相対的優位を示すスパンはあるか
→ 本発表:伊良部語
→
RQ2 — 言語間の問い(類型論)
優位スパンは類似した構造体に集中するか
→ おわりに で英語との比較のパイロットスタディーを述べる
↓
既存:診断バッテリー(diagnostic battery)
基準ごとに答えは ○/×:基準同士を比べる目盛りがない
→ 採る基準は基準の外で決まる = 選択に恣意性が残る
提案:共通尺度で候補を相互比較
2 提案 · 9 / 35
条件 1
cross-domain commensurability
大きさの異なる候補スパンを、同じ規則で比較できる
条件 2
cross-linguistic comparability
同じ比較を他言語へ適用する
条件を明示できる
条件 3
interpretability
値が形態素間の結びつきの強さ(tightness)に結びつく根拠がある
2 提案 · 10 / 35
勾配だけなら
construction / constituency の連続的な違いにすぎない
不連続があれば
その位置のスパンに特権的地位(privileged span)
2 提案 · 11 / 35
| 候補 | 内部接語 =nu (NOM) | 外部接語 =i (CNF) |
|---|---|---|
| MWord | [imsja] [=nu] | [imsja] [=i] |
| ExtWord | [imsja=nu] | [imsja=i] |
| PWord | [imsja=nu] | [imsja] =i |
| clause | 節全体 | 節全体 |
| フット | (im)(sjanu) | (imsja) i *(im)(sjai) |
例:imsja「漁師」(Shimoji 2013: 69, 73, 75)
候補は記述文法から
情報理論とは独立に
記述的観点で事前に定義されている
(Shimoji 2013, 2017)
PWord vs ExtWord
違いは外部接語
(=ju, =ca, =i)の扱いだけ
2 提案 · 12 / 35
S = −log₂ P(次 | 前2つ)
次の形態素を予測するコスト(ビット)
文法要素の継続は予測しやすい、
語彙語根の入口は予測しにくい
2 提案 · 13 / 35
3
3 手法 · 14 / 35
構造からの予測
接尾辞型の言語なら、Root-Affix-Clitic単位で下り坂になりそう
ただし、構造だけでは決まらない
テンプレートは可能なまとまりを指定するだけ。優位は使用(usage)で決まる
→ 予測は条件付き。コーパスで検証するしかない
3 予測 · 15 / 35
① コーパス
形態素列(9,835 トークン)
→
② 機械学習
トライグラム言語モデルを訓練
→
③ 確率
各接合点で P(次 | 前2つ) を推定
→
④ サプライザル
S = −log₂ P を全接合点に付与
9,835
形態素トークン
(語り・会話、9録音)
4,290
ExtWord
1,710
節
3 方法 · 16 / 35
4
4 結果1 · 17 / 35
結果 1 で見るもの
列に沿って進み、どの接合点で S が跳ねるか
接合点タイプごとに集計
affix / clitic / ExtWord / 節 → 上昇は段階的か、崖か
4 結果1 · 18 / 35 例 (2) ffa-gama=nu u-tar=ca「小さい子がいたそうだ」
ExtWord − clitic
6.37
ビット [6.05, 6.65]
4 結果1 · 19 / 35
Δ₂ − Δ₁
4.02
[3.29, 4.63]
Δ₂ − Δ₃
7.62
[6.24, 9.26]
Bonferroni 調整区間、50000 録音ブートストラップ(Table 3)
- - もし単調増加なら
結びつきは段階的に弱まるだけ → construction/constituency の連続的な違い。特権的な位置はない
— 崖なら(観測)
上昇が ExtWord 境界に集中 = 不連続 → その位置のスパン(ExtWord)に特権的地位
4 結果1 · 20 / 35
句中 A:内部基準 C から上昇
句末 B − A:決定不能
+0.46 [−2.22, +3.01]
4 結果1 · 21 / 35 Table 4
5
5 結果2 · 22 / 35
同じ列、同じ S
変わるのは境界/内部の振り分けだけ
境界ごと
d = 境界の S − 内部の S
候補ごと
D = d のコーパス全平均
偶然との差
E = D − ランダム再括弧化の D
5 結果2 · 23 / 35 例 (2) ffa-gama=nu u-tar=ca「小さい子がいたそうだ」 S は保留録音(LORO)採点の実測値(ビット)
同じ「名詞=接語 動詞-接辞=接語」でも、=saai の入口が 23.1 ビットと予測しにくい右の例では MWord が勝つ。
どの候補が優位かは構造ではなく使用(テキスト)が決める → 一発話ではなくコーパス全体で、偶然の括弧化(E)と比べて検定する
5 結果2 · 24 / 35 S は保留録音(LORO)採点の実測値(ビット);右の例は録音 1(namihira)、発話 3
ExtWord − PWord(調整区間)
0.53
ビット [0.26, 0.87]
順序はどの感度分析でも不変
5 結果2 · 25 / 35 超過 E と 95% 録音ブートストラップ区間(Table 5)
名詞は併合すると悪化、
述語複合体は改善
広範な ExtWord 優位と局所的統合は共存(文法化?)
5 結果2 · 26 / 35 全形、Bonferroni 調整(§7.5)
結果 1 シンタグマティック
11.4 ビット
ExtWord 境界の S が最大。上昇は隣接する増分を上回る「崖」
結果 2 パラディグマティック
E = 7.64 ビット
4候補中で最大の超過コントラスト。PWord との差 0.53 [0.26, 0.87]
句との関係
局所
句中でも ExtWord 境界で上昇。句末の追加上昇は不明。SEQ–AUX 併合だけが改善
RQ1:記述された4候補の中で、ExtWord に相対的優位
小括 · 27 / 35
6
サプライザルとは無関係の尺度で、
同じまとまりが支持されるか
6 ポーズ検証 · 28 / 35
検証済みポーズ(verified pause)
間隔 ≥ 200 ms
かつ エネルギー比 < .3(前形態素比)
長さだけでは決まらない。無音の音響的証拠が必要
サプライザルとは独立のパフォーマンス尺度
語内ポーズは遍在する → 有無ではなく率で比較
アラインメント:MMS 強制アラインメント(Pratap et al. 2024)、8995 形態素
6 ポーズ検証 · 29 / 35
ExtWord 内部(affix・clitic)
0.27%
13 / 4734
ExtWord の端(非節)
10.9%
259 / 2379
節境界
10.8%
51 / 472
外部接語(0.6%)も内部接語(0.3%)も、ポーズの上ではスパンの内側
6 ポーズ検証 · 30 / 35 検証済みポーズの率(§8.3, Table 6)
7
7 おわりに · 31 / 35
従来:診断による語の類型論
本研究:共通尺度による候補の比較
「語」の位置
前提:語はあるとして、それを切り出す
検定対象:際立つスパンがあるかを問う。語と呼ぶかは 現段階の範囲外。それはRQ2 の後
尺度
基準ごとに ○/×。基準同士の優劣を比較できない。
よって、どの基準を採るかは基準の外で決まる(診断の循環)
候補は記述文法で先に固定、尺度は一本(S)。情報理論は語の新しい診断ではなく、
候補を比べる物差し
通言語的比較
言語ごとに別の基準で「語」を定義 → 「みんな違って、みんな語」。言語間に比較の物差しがない
RQ2 として独立に実施。RQ1 と同じ共通尺度で、優位スパンの位置と強さを言語間で比較できる
見つけたのは新しい種類の語ではない。
独立に定義された候補(言語個別的な記述の中での様々な「語」を含む)の間で、どれが相対的に優位だったか。
7 おわりに · 32 / 35
ExtWord の優位は内部の差異(affix < clitic)と共存する —— 境界は層状
優位は構造だけでなく
使用(頻度・文脈)に依存する
7 おわりに · 33 / 35
7 おわりに · 34 / 35
英語(GUM)の探索例:名詞句 P Art N-Infl
共通の動機
内部が予測しやすく端が予測しにくい列は、単位として学習・処理される。「語」と呼ばれてきたスパンの一部はその反映
×
言語ごとの形態的制約
接尾辞型・接頭辞・複合・構文頻度がスパンの大きさと構成を決める:伊良部語は語根–接辞–接語、英語は屈折付き名詞
→
新しい語性類型論
情報量の最適化の「結果としての語」は、言語の形態構造の癖に影響され、また運用によって流動するはず。言語の形態類型とテキスト運用を重視した語性類型論が必要
優位なのは屈折を含む名詞:Art・P から切り離した括弧化が最大の E
既存の根拠
最小発話性も韻律も部分的支持。何が文節を一貫して区別するかは未解決
第三の独立した問い
伊良部では文節相当の ExtWord が情報的に優位。日本語でも同じ物差しで検定できるので、やってみたい
図中の文献:橋本 (1934)『国語法要説』 上野 (1989)「日本語のアクセント」
7 おわりに · 35 / 35