共感・質問ローカルAI2026-10-05約4分で読めます

ローカルAIの選び方の基本:モデル名の「B」という数字の意味と速度の関係

自分のPCでAIを動かせるかどうかを判断する際、最も重要な指標の一つがモデルのサイズです。特に初心者の方が最初につまずきやすい「B」という単位の意味と、それによる動作速度の変化について解説します。

この記事で分かること
  • 「B」はパラメータ数(AIの調整値)を表す単位であること
  • モデルが大きくなるほど賢くなる傾向がある一方で、メモリ消費量と処理速度に影響すること
  • 自身のPCスペックに合わせて適切なサイズのモデルを選ぶのが運用のコツであること
ローカルAIの選び方の基本:モデル名の「B」という数字の意味と速度の関係
Threadsに投稿した画像

モデル名の「B」とは何を指しているのか

ローカルAIのモデルを検索したり、ソフトでダウンロードしようとしたりする際、名称の末尾に「4B」や「9B」といった表記を見かけることがよくあります。この数字と「B」は、そのAIが持つ「パラメータ数」を表しています。

パラメータとは、簡単に言えばAIの中の調整値(学習によって最適化された数値)のことです。ここで使われている「B」は、10億を意味する「Billion(ビリオン)」という単位を指します。

したがって、「4B」と書かれていれば約40億個、「9B」と書かれていれば約90億個のパラメータを持っていることを意味します。この数値は、そのAIがどれだけ多くの情報を処理・記憶できる能力があるかを示す目安の一つとなります。

  • 4B = 約40億のパラメータ
  • 9B = 約90億のパラメータ

モデルのサイズと性能・速度の関係

一般的に、AIモデルはパラメータ数が多い(数字が大きい)ほど、より複雑な推論ができるようになり、賢くなる傾向があります。しかし、高い性能を得るためには代償も伴います。

最も大きな影響を与えるのが「メモリの消費量」と「処理速度」です。モデルのサイズが大きくなればなるほど、動かすために必要なビデオメモリ(VRAM)やメインメモリの容量が増大します。同時に、一度に計算しなければならないデータ量が増えるため、AIが文章を生成する速度は低下する傾向にあります。

このため、「より賢いモデルを使いたいけれど、自分のPCでは動作が遅すぎる」という状況や、逆に「高速に動かしたいけれど、回答の精度が物足りない」といったトレードオフが発生します。自分のPC環境において、どの程度の速度と賢さを求めるかによって、最適な「B」の数値を検討する必要があります。

  • 大きなモデル:賢くなる傾向があるが、メモリを多く消費し、速度は遅くなる
  • 小さなモデル:動作が軽量で速いが、複雑な推論には限界がある場合がある

このサイトの実測データ

生成速度(トークン/秒)GPUあり(RTX 4080)CPUのみ★ gemma3:1bメモリ 0.9GB216.961.7★ qwen3.5:2bメモリ 2.3GB170.427.7★ gemma3:4bメモリ 2.8GB142.021.5★ qwen3.5:4bメモリ 3.1GB132.119.3★ qwen3.5:9bメモリ 6.0GB96.411.2
このサイトの運営PC(Ryzen 7 9800X3D / メモリ31GB / RTX 4080(VRAM 16GB))で、同じ質問に答える速さを実測。測り方

実測による体感の目安

実際にどの程度の差が出るのかを把握するために、当実験室の環境(RTX 4080搭載PC)で測定した数値を参考にしてみましょう。ここで比較するのは「gemma3:4b」と「qwen3.5:9b」という2つのモデルです。

まず、約40億パラメータを持つ「gemma3:4b」の場合、実測で142.0トークン/秒を記録しました。これは、一瞬で文字が出てくる感覚であり、非常に快適な速度です。

一方で、約90億パラメータを持つ「qwen3.5:9b」の場合は、実測で96.4トークン/秒でした。この数値も、読むより速いくらい快適な速度ですが、4Bモデルと比較すると、サイズが大きくなることで処理に時間がかかっていることがわかります。

※トークンとは、AIが文章を扱う際の最小単位です(日本語の場合はだいたい1〜2文字程度に相当します)。

このように、モデルのサイズを大きくするほど速度は落ちる傾向にありますが、今回のケースではどちらも非常にスムーズに動作しています。自分のPCのメモリ容量を確認しつつ、まずは自分が求める「快適さ」と「賢さ」のバランスが取れるモデルを探してみることが大切です。

  • gemma3:4b(約40億):142.0トークン/秒 = 一瞬で出る
  • qwen3.5:9b(約90億):96.4トークン/秒 = 読むより速く快適

まとめ:自分に合ったモデルの探し方

ローカルAIを自分のPCで動かすための第一歩は、まず自分のPCのメモリ容量(特にGPUのビデオメモリ)を確認することです。その上で、モデル名の「B」という数字を見て、適切なサイズを選んでいきましょう。

最初は、動作が軽く高速な小さなモデルから試し、自分のPCでどの程度の速度が出るかを確認するのがおすすめです。慣れてきたら、より大きなパラメータを持つモデルに挑戦し、精度や回答の質を比較していくというステップを踏むと、スムーズにローカルAIの活用が進められるでしょう。

  • PCのメモリ容量を確認する
  • 最初は小さいサイズ(例:4Bなど)から試す
  • 速度と賢さのバランスを見極める
👍 こんな人におすすめ
  • AIに興味はあるが、自分のPCで動かせるか分からない人
  • ChatGPTなどの有料サービスに頼らず、手元でAIを動かしたい人
  • AIイラストを始めたい人
🤔 あまり関係ない人
  • ゲーム機に関する話題
  • クラウド企業向けサービス
  • AIと関係の薄い開発ツールの話題

よくある質問

Q. Bの数字が大きいほど、必ず賢くなりますか?

公式の情報では一般的に大きいほど賢くなりやすいとされていますが、学習データの質やモデルの設計によっても変わるため、必ずしも比例するとは限りません。

Q. 自分のPCで動かない場合はどうすればいいですか?

まずは「B」の数字を小さくしたモデル(例:4Bなど)から試してみてください。モデルが小さくなるほど、必要なメモリは少なくて済み、動作も軽くなります。

この記事は、AIが情報源をもとに作成し、数字や型番を情報源と機械的に照合しています。誤りに気づいた方はThreadsで教えてください。
このサイトの定番解説です。数値はこのサイトの実測にもとづきます。

関連記事

新しいモデルの実測や解説を毎日投稿しています

Threadsでフォロー