あそぶ・実験

AIはこうやって文章を作る マルコフ連鎖シミュレーター

ChatGPTがやっていることを一言でいえば「次に来る言葉を予測する」。その最小版が、直前の数文字から次の文字の出現確率を数えるだけの「マルコフ連鎖」です。好きな文章を貼り付けて学習させ、記憶の長さと“温度”を変えると、AIらしさと暴走の境目が見えてきます。

🧪 n-gram言語モデル(マルコフ連鎖)+温度サンプリング
学習した文字の種類
覚えたパターン数
次の文字の平均候補数
元の文章にない4文字組

ポイント:大規模言語モデルも本質は「これまでの文脈から、次の語の確率分布を出し、そこから1つ選ぶ」の繰り返しです。マルコフ連鎖はこれを直前 n 文字だけを見て、出現回数を数えるという最小の方法で行います。n を増やすと文章らしくなり、増やしすぎると元の文章の丸写しになる——AIの「学習」と「暗記」の境目がここにあります。

しくみ:確率表を作って、サイコロを振る

ステップ内容
1. 学習文章を先頭から読み、「直前 n 文字 → 次の1文字」の組み合わせを全部数える(確率表を作る)
2. 生成最初の n 文字を決め、表を引いて次の文字を確率に従って選ぶ。それを繰り返す
3. 温度確率の“とがり方”を調整。低温=最も多い文字ばかり選ぶ(無難)、高温=珍しい文字も選ぶ(創造的だが破綻)

1948年、クロード・シャノンは論文「通信の数学的理論」でこの方法を示し、英語の文字の統計だけから“英語らしい”文字列が生成できることを実演しました。現代の言語モデルは「直前 n 文字」を「数千語の文脈」に、「数える」を「ニューラルネットワークで推定する」に置き換えたものですが、「次を予測してサンプリングする」骨格は同じです。

スライダーで見える「AIの性格」

設定出てくる文章
n = 1〜2文字の並びはそれっぽいが意味不明。“言語らしさ”の最小単位
n = 3〜4単語や言い回しが出てくる。短い文章では丸写しが混ざる
n = 5〜6ほぼ元の文章の丸写し(過学習・暗記)。学習データが少ないとこうなる
温度 0.2〜0.5同じフレーズを繰り返す。“無難で退屈なAI”
温度 1.5〜2.0破綻した文字列。“幻覚(ハルシネーション)”の最小版

「AIは丸暗記している」は本当か

本ページで n を6にすると、生成文はほぼ学習文の切り貼りになります。学習データに対してモデルの記憶容量が大きすぎるときに起きる現象で、大規模モデルでも学習データに何度も出てくる文章(有名な詩・ライセンス文など)はそのまま出力されることがあります。一方、n=3で十分な量の文章を学習させると、元にない組み合わせ(右下の「元の文章にない4文字組」)が増え、「学習」と「暗記」の違いが数字で見えます。

引用・転載について

本ページのシミュレーション結果・数値は、出典を明記いただければブログ・ニュース記事・SNS・授業や社内資料への引用を歓迎します。事前連絡は不要です。

推奨クレジット表記:出典:シミュラボ「AIはこうやって文章を作る マルコフ連鎖シミュレーター」 https://shimulabo.com/sims/markov-bunsho/

よくある質問

これはChatGPTと同じ?
原理の骨格(次の文字の確率を推定し、サンプリングする)は同じですが、ChatGPTは数千億のパラメータを持つニューラルネットワークで文脈全体を読み、単語の意味の近さも扱います。本ページは「数える」だけの最小版で、その差が“賢さ”の差です。
「次の文字の平均候補数」とは?
確率表の各文脈で、次に来うる文字の種類数の平均です(パープレキシティに近い概念)。大きいほどモデルが迷っており、小さいほど文章が決まりきっています。
貼り付けた文章は送信される?
いいえ。学習も生成もすべてブラウザ内で行い、サーバーには何も送られません。

💡 こんなシミュも見てみたい?

あなたの「これ数字で見たい」を送ってください。投票で人気の案から実際に作ります。

リクエストする →
🗳️ みんなのリクエストに投票する →