← Notes

Notes / note

中国語は二文字、日本語は三文字?

台湾で感じた漢字のリズムを予備集計へ。品詞を絞ると二字語率の差が逆転した結果から、街頭表示とコーパスで数えているものを分ける。

台湾の街を歩いていて、中国語は「二文字、二文字、二文字」と意味がまとまっていることが多い気がした。日本語だと、もう少し三文字の塊が目につく。「新○○」のような語を思い浮かべたからかもしれない。

2026年9月26日に、そんな違和感を少し数えてみることにした。最初の予備集計で面白かったのは、中国語と日本語のどちらに二字語が多いかが、集計対象を変えると逆転したことだ。

ただし、使ったのは街頭の看板ではない。公開コーパスの漢字だけで書かれた語を数えた。したがって、これは旅先の印象への直接の答えではなく、何を比べれば答えに近づけるかを考える第一段階になる。

「語の長さ」の前に、語の境界がある

たとえば「研究所」は、見た目には三文字だ。しかし、国立国語研究所のBCCWJの説明では、短単位として「研究|所」と区切る例が示されている。同じ資料には、短単位と長単位という異なる分析単位がある。資料1

この区切りなら、三字の一語ではなく、二字の単位と一字の単位として数える。文字数を数える処理が正確でも、その前段階の分割が違えば、得られる分布は違う。

街で僕が見ていたのは、形態論的な単語なのか、意味がひとまとまりに感じられる表現なのか。それとも、看板の改行や余白がつくる視覚的な塊なのか。まず、ここを分ける必要があった。

公開コーパスで、いったん数えた

予備比較に使ったのは、Universal DependenciesのChinese GSDとJapanese GSDだ。公式説明では、前者は繁体字中国語のwiki資料、後者はnews・blog資料で、日本語側には短単位に基づく再処理の経緯がある。資料2・資料3

両者のtrain・dev・testをまとめ、付与済みの語境界をそのまま使った。繁体字中国語4,997文、日本語8,100文。そのうち表記がすべて対象の漢字範囲に入る語の出現は、それぞれ101,300件と55,937件だった。

これは繁体字で書かれた資料の比較であり、台湾華語の代表標本との比較ではない。ジャンルもそろっていない。

漢字仮名交じりの語は対象外とし、「々」を含む語も除外した。数えているのは語の表記の文字数で、音節数やモーラ数ではない。さらに、同じ語が何度も出たらその都度数える出現回数と、一種類として数える異なり語数を分けた。

条件を変えると、差の向きが変わった

以下は2026年9月26日の保存済み集計結果。割合の分母は各行の対象集合で、差は丸める前の値から計算した。

集計対象繁体字中国語の二字率日本語の二字率差:中国語−日本語
漢字のみの語・全出現52.00%67.14%−15.14ポイント
漢字のみの名詞・動詞・形容詞・全出現74.59%67.39%+7.20ポイント
漢字のみの語・異なり表記79.96%86.83%−6.87ポイント
原文に連続して現れる漢字列8.20%41.09%−32.89ポイント

全出現では日本語側の二字率が高い。名詞・動詞・形容詞に絞ると、中国語側が高くなる。「中国語には二字語が多い」と言うとき、どの集合を思い浮かべているのかで、比べる数字が変わってしまう。

ここでいう名詞・動詞・形容詞はUPOSのNOUN・VERB・ADJだけで、固有名詞PROPNや副詞ADVは含めていない。「内容語すべて」を網羅する分類ではない。

全出現に占める三字語も確認すると、中国語側1.93%、日本語側0.93%だった。この区切り方では、日本語側の三字語が多いという結果にはならない。ただし、先ほどの「研究|所」のような分割の影響も含むため、街頭で三文字の塊をよく見たという印象の反証にもならない。

混ぜ方が違えば、平均も違う

逆転を考えるため、対象を名詞・動詞・形容詞の集合 CC と、それ以外の集合 OO に分ける。pCp_C と pOp_O をそれぞれの二字率、α\alpha を全対象に占める CC の出現割合とすると、全体の二字率は定義から、

p=αpC+(1−α)pOp=\alpha p_C+(1-\alpha)p_O

となる。すべて0から1の割合で、これは言語モデルではなく集計の恒等式だ。

したがって、pCp_C が高い言語でも、二字率の低い残りの集合が多ければ、全体の pp は低くなる。中国語では「的」「了」などの一字の語も漢字表記として対象に入る。一方、日本語では仮名だけの助詞は「漢字のみ」という入口で除外される。最初のフィルターから、対称な比較ではない。

この逆転の原因を一字の機能語だけで説明し切ったわけではない。品詞の付け方、固有名詞、ジャンル、語境界も変数として残る。次には品詞別の比率を分け、同じ重みで集計した場合にも差が残るかを見る必要がある。

精密に数えても、看板には届かない

保存済みの分析では、文を単位に4,000回再抽出するブートストラップも実施している。全出現の二字率の差の95%区間は−15.71〜−14.54ポイント、名詞・動詞・形容詞に限った差は+6.54〜+7.86ポイントだった。

区間が狭くても、台湾の看板と日本の看板の差を推定したことにはならない。この手続きが扱うのは、選んだ資料内の文の再抽出による揺れで、資料のジャンルや語分割の違いは消えない。文書内の文の依存も、この再抽出では扱っていない。

原文の連続漢字列にも別の問題がある。中国語では単語をまたいで漢字が続くので、長い文字列が一つとして数えられる。「二字+二字」の内側の切れ目は復元できない。四文字が続いていると分かっても、それがどこで意味を区切られて読まれたかは別だ。

次は、街で見た単位を残す

次の比較では、台北と東京の同種の表示を集めたい。駅の案内、飲食店のメニュー、店名を別々にし、撮影場所を先に決めて、目を引く例だけを選ばないようにする。

一枚の表示に対して、元の改行・余白を残した転記と、人手で付けた語境界を両方保存する。語境界が割れるところも消さずに残す。これなら、言葉そのものの長さ、表示のデザイン、読む側の区切り方を少しずつ分けられる。

その上で、同じ表示分類、同じ語境界の扱いで比較しても差が残れば、旅先の印象に近づける。差が消えるなら、僕が拾っていたのは言語全体の特徴ではなく、特定の表示や自分の読み方だった可能性がある。

二文字と三文字の違いを数えようとしたら、先に「どこまでを一つと思っていたのか」が問いになった。旅先で見たリズムは、まだ答えではない。でも、次に何を見ればいいかは少し具体的になった。

Sources・再現資料

  • 筆者の台湾旅行後の問いと予備集計(2026-09-26)。表・区間は当日の保存済みCSV・JSONから掲載。今回、集計表の件数と割合を再計算して照合した。原コーパスからの全再実行はしていない。
  • 資料1:国立国語研究所「BCCWJ 形態論情報」。短単位・長単位と「研究|所」の例を参照。BCCWJ自体は今回の数値集計には使っていない。
  • 資料2:UD Chinese GSD、資料3:UD Japanese GSD。データの性質・ジャンル・分割方針・ライセンスの公式説明。両データの表示ライセンスはCC BY-SA 4.0。
  • 分析コード・手順・保存済み集計。リポジトリの閲覧権限が必要。元データのURL・SHA-256・件数をsummary.jsonに保存。取得先は可変のmasterであり、厳密な再現には当時と同じハッシュのデータが必要。原文コーパスは同梱していない。
  • 外部資料の確認日:2026-09-27。

Related notes つながる問い

  1. 思いついた瞬間に、考え切らなくていい

    疑問を捕まえる時間と、後で考える時間を分ける。待ち行列と復元確率のモデルから、メモの長さと見返す間隔を考える。

  2. 英語が難しいのか、世界が難しいのか

    Bloombergの文章が洋書SFより読みやすいという体感から、言葉と世界設定の負荷を分けて考える。