ローカルLLMを動かすには、Macのメモリはどれだけ必要か?

macOSTahoe ·
ローカルLLMを動かすには、Macのメモリはどれだけ必要か?

統合メモリはどのモデルをロードできるかを決め、帯域幅はどれだけ速く答えるかを決めます。512GBのMac Studioまで、2026年の全Macモデルについての計算方法をまとめました。

Appleの新しいMac Studioは、統合メモリの上限が512GBに達しました。報道の論調は「これでフロンティア級のモデルをデスクに置ける」というものです。それは大枠では正しいのですが、実はほとんどのMac購入者が尋ねてもいない問いに対する答えでもあります。

実際に彼らが抱いている問いは、もっと狭く、もっと実用的です。自分が動かしたいものを踏まえると、実際にはどれだけのメモリを買う必要があるのか? 統合メモリはチップパッケージにハンダ付けされています。この問いに答えるチャンスは、購入時のレジでの一度きりであり、それがマシンの寿命が尽きるまで続きます。

良いニュースは、これが意見の問題ではなく、単なる計算だということです。この記事ではその計算を行います。

要点まとめ

  • すべてを決めるのは2つの数値です。 メモリの容量はモデルがそもそもロードできるかどうかを決め、メモリの帯域幅はテキスト生成の速さを決めます。この2つは互いに独立しており、一方が強くても他方が弱いマシンは存在します。
  • 重みは「パラメータ数 × パラメータあたりのバイト数」で見積もれます。 4bit量子化では1パラメータあたり約0.55バイトなので、70Bモデルはコンテキストを含める前で約38GB必要になります。
  • macOSはGPUにRAMをすべて使わせてはくれません。 iogpu.wired_limit_mb によって制御される、非公開の上限が存在します。32GBのMacでも、モデルのために32GBをまるごと使えるわけではありません。
  • Appleが大々的に打ち出すAIの数値は、プロンプト処理についてのものであり、テキスト生成についてではありません。 両者はボトルネックが異なります。表現を注意深く読んでください。
  • M5 Ultraの容量自体は目新しいものではありません。 M3 Ultraはすでに2025年の時点で512GBを提供していました。変わったのは帯域幅で、819GB/sから1.2TB/sになりました。

2つの数値

AI用にMacを選ぶ際の失敗のほとんどは、この2つを1つの数値として混同することから生まれます。

容量は壁です。 モデルとそのコンテキストがメモリに収まらなければ、そもそも動作しません。システムRAMに溢れさせられる単体GPUのような緩やかな性能劣化は、Apple Siliconにはありません——Macでは統合メモリがそのままシステムRAMそのものであり、macOSがGPUに渡す量を超えた瞬間、ロードに失敗するか、はるかに遅い何かにフォールバックするかのどちらかになります。

帯域幅は速度制限です。 1トークンを生成するために、密なモデルはメモリから重み全体を読み出します。それも毎トークンごとにです。つまり生成速度の理論上限は「メモリ帯域幅 ÷ モデルサイズ」で決まり、GPUコアをいくら増やしてもこれは変わりません。

これが、200GBのモデルを保持できるマシンでも実用に耐えないと感じられたり、控えめなマシン上の小さなモデルが瞬時に応答するように感じられたりする理由です。

容量:何が収まるか

重みが支配的なコストであり、これは予測可能です。

memory for weights ≈ parameters × bytes per parameter

パラメータあたりのバイト数は量子化方式によって変わります。

精度パラメータあたりのバイト数主な用途
FP16 / BF162.0学習、最大の忠実度
8-bit (Q8)~1.0ほぼ無損失な推論
4-bit (Q4_K_M)~0.55実用上のデフォルト
3-bit~0.42顕著な品質低下

4bitのK-quantは、スケーリング用のメタデータを含めると平均して4bitをわずかに上回るため、正直な数値は0.50ではなく0.55になります。これを当てはめると次のようになります。

モデルサイズ4-bit8-bitFP16
8B4.4 GB8 GB16 GB
14B7.7 GB14 GB28 GB
32B17.6 GB32 GB64 GB
70B38.5 GB70 GB140 GB
120B66 GB120 GB240 GB
235B129 GB235 GB—
400B220 GB400 GB—
671B369 GB671 GB—

さらにコンテキストを加える

KVキャッシュは会話中の各トークンについてattentionのキーと値を保持しており、コンテキスト長に比例して線形に増加します。トークンあたりのサイズはアーキテクチャによって大きく異なり——グループ化クエリアテンション(GQA)を使うモデルは、古い設計よりもここがはるかに軽量です——ただ実用上の目安としてはトークンあたり0.1MB〜0.5MBの範囲になります。

32,000トークンのコンテキストであれば、重みに加えて概ね3GB〜16GBが上乗せされます。128,000トークンになると、モデル本体を上回ることさえあります。

これが「収まるはず」のモデルが実際には収まらない、最もよくある原因です。長い文書を読み込ませたり、長い会話を続けたりする予定があるなら、重みだけを基準にして「なんとかなるだろう」と期待するのではなく、明示的に予算を確保してください。

実用的な計算式

memory you need ≈ (weights) + (KV cache for your context) + 2–3 GB overhead

そして、これを「macOSが実際にGPUへ渡してくれる量」と照らし合わせます。それは箱に書かれている数字ではありません。

誰も言及しない上限

macOSはシステムのために統合メモリを確保し、GPUがワイヤード(固定)できる量に上限を設けています。そのつまみとなるのがsysctlです。

$ sysctl iogpu.wired_limit_mb
iogpu.wired_limit_mb: 0

0は「自動」を意味します。Appleは自動設定が実際にどう解決されるかを文書化しておらず、ここで筆者が独自の計算式をでっち上げるつもりもありません——ただ、コミュニティによる計測では一貫して総メモリの65〜75%程度に落ち着いており、大容量のマシンほど大きな割合が許可される傾向があります。

実際に購入を検討しうるマシンでの、具体的な結果は次のとおりです。

搭載メモリGPUに割り当てられるおおよその量
16 GB~10–12 GB
32 GB~21–24 GB
64 GB~42–48 GB
128 GB~85–96 GB
512 GB~340–384 GB

この上限は引き上げることができます。設定は即座に反映されますが、再起動を挟むと維持されません。

# Allow the GPU to wire 28GB on a 32GB Mac
sudo sysctl iogpu.wired_limit_mb=28672

# Back to automatic
sudo sysctl iogpu.wired_limit_mb=0

この操作は慎重に行ってください。ここで確保する分は、すべてOSと他のあらゆるアプリケーションから奪うことになります。上限を総メモリぎりぎりまで押し上げると、スワップやビーチボール、あるいはメモリ不足によるプロセスキルに見舞われます——そして高速SSDを積んだMacであっても、メモリ圧迫下でのスワップは持続的な書き込み負荷になります。System has run out of application memory というダイアログを見たことがあるなら、これもその原因の一つです。

妥当な上限は、総メモリからmacOS本体と他のアプリ用に6〜8GBを差し引いた値です。設定したらモデルを動かし、アクティビティモニタでメモリ圧迫の状況を確認してください。全般的にメモリ圧迫のスパイクが見られる場合は、Macメモリ管理ガイドで診断方法を扱っています。

メモリ容量と帯域幅の比較

帯域幅:応答の速さ

ここで重要になる見積もり式を、正確に示します。

tokens per second ≈ (memory bandwidth × efficiency) ÷ weight size in bytes

効率係数は、理論上のピーク帯域幅と推論エンジンが実際に達成できる値との差を反映したものです——十分に最適化されたランタイムを使ったApple Siliconでは、おおむね0.6〜0.8になります。以下では0.7を用います。

これらは公表されている帯域幅の数値から計算した見積もりであり、筆者が実際に計測したベンチマークではありません。 実測値としてではなく、正しい桁数と正しい相対的な順序を示すものとして扱ってください。実際の数値は、ランタイム、量子化方式、コンテキスト長、熱の挙動によって変動します。

4bitの**密な(dense)**モデルにおける生成速度は次のとおりです。

M6 (170GB/s)M5 Pro (307GB/s)M5 Max (614GB/s)M5 Ultra (1.2TB/s)
8B (4.4GB)~27 tok/s~49 tok/s~98 tok/s~190 tok/s
32B (17.6GB)~7 tok/s~12 tok/s~24 tok/s~48 tok/s
70B (38.5GB)収まらない~6 tok/s~11 tok/s~22 tok/s
120B (66GB)収まらない収まらない~7 tok/s~13 tok/s

参考までに、快適に読める速度はおよそ毎秒10トークンです。おおよそ5を下回ると、大半の人はそのモデルを使わなくなります。

32Bの行に注目してください。これは1つの同じモデルでありながら、収まるかどうかは変わらないまま、ぎりぎり我慢できる速度から本当に速い速度まで幅があります。これは容量ではなく帯域幅の話であり、「かろうじてモデルが収まる」という理由だけで最安のマシンを選ぶ人が見落としがちな軸です。

MoEモデルが答えを変える理由

Mixture-of-Experts(MoE)モデルは、上記のルールを覆します。そしてこれこそが、512GBのマシンが興味深い理由のすべてです。

MoEモデルは多数のエキスパートサブネットワークを保持していますが、1トークンごとに使われるのはそのうちのごく一部だけです。アクティブパラメータが22Bの235Bモデルは、235B分の重みを保持しなければなりませんが、各トークンを生成するために読み出すのは約22B分だけです。

つまり:

  • 容量は総パラメータ数によって決まります——4bitで129GB。
  • 速度はアクティブパラメータ数によって決まります——22Bの密なモデルと同等であり、235Bの密なモデルなら約9 tok/sしか出せないところ、M5 Ultraではおよそ40 tok/sになります。

この非対称性こそが、コンシューマー向けGPUでは実用的とは言えない大規模MoEモデルを、Apple Siliconでは実用的なものにしています。必要なのは容量であり、Appleはこの価格帯で他のどこも実現していない形でそれを提供しています。そして得られる速度は、はるかに小さなモデルに見合ったものです。

これはまた、「512GBならフロンティアモデルが動く」という言葉が真実ではあっても不完全である理由でもあります。実用的な速度で動くのはスパースなフロンティアモデルです。仮に400Bの密なモデルを4bitで動かすとすれば、220GBを占有し、M5 Ultraでの生成速度は毎秒4トークン程度になります。収まりはしますが、快適には使えないでしょう。

プロンプト処理はまったく別の問題

新しいMac miniに関するAppleの主張を、正確に読んでみましょう。

M4比で最大4.8倍高速な LLMプロンプト処理 M1比で最大13.5倍高速な LLMプロンプト処理

プロンプト処理——プリフィル(prefill)——は、モデルが与えられた入力を取り込む段階です。入力のすべてのトークンが並列に処理されるため、これは**計算律速(compute-bound)**になります。すなわちGPUのスループット、各GPUコアに新たに組み込まれたNeural Accelerator、そしてM6で初めて搭載されたデュアルNeural Engineに応じて性能が向上します。

トークン生成——デコード(decode)——は1トークンずつ行われ、そのたびに重み全体を通しで読む必要があります。これは**帯域幅律速(bandwidth-bound)**であり、計算能力をいくら増やしても解決しません。

Appleは、宣伝する対象として計算律速側の性能を選びました。これは誤解を招くものではなく、実際にこの世代で最も向上したのがこちら側だったからです。ただしこれは、マーケティングの数値が示しているのは「50ページの文書をどれだけ速く読み込むか」であって、「その要約をどれだけ速く書き出すか」ではない、ということを意味します。

どちらを重視すべきかは、あなたの用途次第です。

  • 長い入力・短い出力——文書の要約、分類、コードベースからの抽出など——はプリフィル支配的です。Appleの数値が当てはまります。
  • 短い入力・長い出力——文章の下書き、チャット、コード生成など——はデコード支配的です。重視すべきは帯域幅です。
  • 長い入力と長い出力の両方——大きなコンテキストにわたるエージェント的なワークフローなど——では両方が必要になり、さらにKVキャッシュのための容量も上乗せで必要になります。

M5 Ultraで実際に変わったこと

発表時の一部の報道は、デスクトップでフロンティア級モデルを保持できることがまるで新しいことであるかのように伝えていました。実際には新しくありません。この点を正しく理解しておくことは、すでにMac Studioを所有している人にとってアップグレードの判断を左右します。

M3 Ultra (2025)M5 Ultra (2026)
最大統合メモリ512GB512GB
メモリ帯域幅819GB/s1.2TB/s
GPUコア数最大80最大80
CPUコア数32最大36

容量は変わっていません。GPUコア数も変わっていません。 帯域幅は約1.47倍になり、CPUコアが4つ増えました。

これは、AppleがM3 Ultraとの比較として公表している数値とも正確に一致します——「マルチスレッド性能が最大1.3倍」「グラフィックス性能が最大1.8倍高速」というのは控えめな数値であり、Appleが大きく打ち出す「AI計算のピーク性能が最大4.3倍」という主張は、コアの数や規模の増加からではなく、各GPUコアに新たに組み込まれたNeural Acceleratorに由来しています。

ローカル推論に限って言えば:

  • 生成速度は帯域幅の向上にほぼ比例して改善します——同じモデルでおよそ1.4倍程度と言えるでしょう。
  • プロンプト処理は、AI計算性能の4.3倍という数値に沿って、はるかに大きく改善します。
  • ロードできる内容は変わりません。

512GB搭載のM3 Ultra Mac Studioをすでに所有していて、制約が「どのモデルが収まるか」であるなら、この新世代はあなたの抱える問題を解決してくれません。一方、制約が「長いプロンプトの処理を待つ時間」であるなら、これはまさにその問題に直接応えてくれます。前世代について詳しくは、Mac Studio M4 Max・M3 Ultraパフォーマンスガイドで扱っています。

注文前に知っておく価値のある、もう一つのスケジュールに関する注意点があります。512GB構成は、他のモデルと同じ9月22日には出荷されません。 Appleによれば、到着は10月下旬になるとのことです。

ローカルAI向けのMac構成を選ぶ

実際の用途別に見る、どのマシンを選ぶべきか

16GB——この用途には向かない

GPUに使えるのはおおよそ10〜12GBです。これで動くのは、控えめなコンテキストでの4bit・8Bモデルまでで、それより大きなモデルは動きません。オートコンプリート級のモデルや小さなローカルアシスタントには十分ですが、それ以外の用途ではストレスが溜まるでしょう。2026年時点で16GBは、LLM以外のことを得意とし、LLMはあくまでついでに動かすマシンです。

32GB(M6 Mac mini、最大構成——$1,299)——エントリーポイント

使えるのはおよそ21〜24GBです。8Bと14Bモデルは快適に動き、32Bモデルも短いコンテキストでの4bitなら毎秒約7トークンで動きます。この最後の数字が正直な限界です——収まりはしますが、快適さのぎりぎり際にあります。

向いている用途:ローカルのコーディングアシスタント、プライベートな文書作業、ツールの学習。ローカルモデルを使いたいことがマシン購入の理由の一つであるなら、16GBからの$400のアップグレードは選択の余地がありません。

64GB(M5 Pro Mac mini——$1,699〜)——ほとんどの人にとってのスイートスポット

使えるのはおよそ42〜48GBで、帯域幅は307GB/sです。70Bモデルは4bitであれば実用的なコンテキストの余地を残して収まり、生成速度は毎秒約6トークンです——バッチ処理には使えますが、対話的なチャットには遅く感じます。32Bモデルはおよそ毎秒12トークンで動作し、こちらは快適です。

本格的にローカルモデルを使う人の多くが、最終的にこの構成に落ち着きます。筆者が大半の人に勧めるのもこの構成です。さらにThunderbolt 5も搭載されており、これはM6 miniにはない機能です。

128GB(M5 Max Mac Studio——$2,499〜)——プロフェッショナル向けの層

使えるのはおよそ85〜96GBで、帯域幅は614GB/sです。4bitの70Bモデルはおよそ毎秒11トークンで動作し、対話用途として快適です。120B級のモデルも収まります。中規模のMoEモデルも実用的になります。

これは、日常的にローカル推論に業務が依存している人向けの構成です——帯域幅は同じモデルでのM5 Proの生成速度をおよそ2倍にします。

512GB(M5 Ultra Mac Studio——$5,499〜、フル構成では$18,000超)——他では買えない容量

使えるのはおよそ340〜384GBで、帯域幅は1.2TB/sです。これなら4bitの400B級MoEモデルを保持でき、そのアクティブパラメータ数に見合った速度で生成できます。これはまさに、この価格帯で他のどのデスクトップも実現できない特有の性能です。

他の方法では解決できない容量の制約を抱えているなら、これを買う価値があります。もしあなたのモデルが128GBに収まるなら、Ultraで得られるのは、もっと安く手に入れられるはずの速度でしかありません。

新しいMacを買わない場合

十分なメモリを備えた既存のM1/M2/M3/M4 Macでも、ローカルモデルは問題なく動きます——ProやMax系統の帯域幅は、すでに何世代にもわたって良好です。自分のマシンの数値を確認してみましょう。

# Total memory in GB
echo "$(( $(sysctl -n hw.memsize) / 1073741824 )) GB"

# Chip and current GPU wired limit
sysctl -n machdep.cpu.brand_string
sysctl iogpu.wired_limit_mb

その後、上記の表を当てはめてください。400GB/sの64GB M1 Maxは、ローカル推論用マシンとして申し分なく、それは今も昔も変わりません。

具体的な計算例

抽象的な表はうなずくのは簡単でも、実際の行動に落とし込むのは難しいものです。ここでは、一つの具体的なケースにこの考え方を当てはめてみます。

要件: ある程度大きなコードベースを読み込み、32,000トークンのコンテキストを保持し、対話的に応答するプライベートなコーディングアシスタント。小さいモデルはコードに関して明らかに劣るため、32B級のモデルが欲しいとします。

ステップ1——重み。 4bitの32B:32 × 0.55 = 17.6GB。

ステップ2——コンテキスト。 現代的なグループ化クエリアテンションのモデルで、トークンあたり約0.2MBとすると、32,000トークンで約6.4GB。これは見落とされがちな項目ですが、ここでは重みのサイズの3分の1を超えています。

ステップ3——オーバーヘッド。 ランタイム、Metalバッファ、トークナイザー:2〜3GB。

合計:GPU用にワイヤードする必要があるのはおおよそ26〜27GB。

ステップ4——搭載メモリへの換算。 自動上限が約70%だとすると、27GBのワイヤードには約38GBの搭載メモリが必要です。32GBのMacでは自動的に得られるのは21〜24GBで、足りません。32GBのマシンでiogpu.wired_limit_mbを27GBまで引き上げることも可能ですが、その場合macOSと他のすべてに残るのはわずか5GBです。それで動くのは他に何も動いていない間だけで、ブラウザを開いた瞬間に破綻します。

結論:搭載メモリは64GB。 これはM6ではなく、M5 Pro Mac miniに該当します。

ステップ5——速度の確認。 307GB/s × 0.7 ÷ 17.6GB ≈ 毎秒12トークン。対話用途として快適です。

ここで一つだけ変数を変えてみましょう。他はすべてそのままに、128,000トークンのコンテキストを要求すると、KVキャッシュはおよそ25GBに達し、合計の必要量は約45GBになります。そして必要な搭載メモリは、ワイヤード上限を引き上げた上で最低でも64GB——快適に使うには128GBが必要になります。設定を一つ変えただけで、答えが製品層まるごと一段階上に動いたのです。

これがこの方法のすべてです。重み、コンテキスト、オーバーヘッドを足し、上限で割り、そして帯域幅を重みのサイズと照らし合わせて確認する。

ランタイムはすべて同じように振る舞うわけではない

ここまでの計算はハードウェアについて説明したものです。実際に目にする挙動はソフトウェアに依存しており、その違いは購入の判断を左右するほど大きなものです。

MLXは、統合メモリ向けに構築されたApple自身の配列フレームワークです。Apple Siliconには「CPUメモリ」と「GPUメモリ」という区別がそもそも存在しないため、両者間でのコピーを行いません。Mac上では概して最もメモリ効率の良い選択肢です。ローカル推論を目的にハードウェアを購入するのであれば、MLXベースのツール群こそがそのハードウェアの実力を最大限に引き出します。

llama.cpp、およびそれをベースにしたツール群は、最も可搬性の高い選択肢であり、Metalのサポートも優れています。その量子化フォーマット——上記の表が前提としているQ4_K_M系列——は事実上の標準であり、メモリの挙動も予測可能で十分に文書化されています。

Ollamaは、llama.cppをモデル管理機能でラップしたものです。便利ですが、知っておくべきなのは、使い終わったモデルを設定可能な期間だけメモリ上に常駐させ続けるという点です。上限ぎりぎりで運用している場合、1時間前に使い終わったはずのモデルが、まだメモリを占有しているかもしれません。これが「昨日は動いたのに」という現象のよくある原因です。

LM StudioはGUIの選択肢で、メモリについて正直に表示してくれます。ロードする前に、収まるものと収まらないものを教えてくれます。計算をせずにこれらの数値に対する感覚を養うには良い方法です。

どれを使うにしても、重要な挙動が2つあります。

  1. KVキャッシュが事前確保されるかどうか。 一部のランタイムはロード時にコンテキストウィンドウ全体を確保し、他は会話の進行に合わせて拡張していきます。事前確保の場合、実際には動作するはずのモデルがロードに失敗することがあります。128Kではロードに失敗するのに8Kならロードできる場合、これが原因です——解決策は設定するコンテキストを小さくすることであり、モデルを小さくすることではありません。
  2. 使われていないモデルがアンロードされるかどうか。 自分のマシンが小さすぎると結論づける前に、使用しているランタイムのkeep-alive設定を確認してください。

メモリを買わずに余裕を作る方法

メモリ層のアップグレードに$400を費やす前に、計算そのものを変えるいくつかのテクニックがあります。

より強く量子化する。 8bitから4bitに落とすと、品質低下はわずかで済む一方、メモリ必要量は半分になります。これはほとんどの場合、より高精度な小さいモデルに乗り換えるよりも良いトレードオフです——4bitの32Bモデルは、同程度のメモリで比較すると、8bitの14Bモデルを概ね上回ります。

KVキャッシュを量子化する。 ほとんどのランタイムは、KVキャッシュを8bit以下で保存できます。キャッシュが重みに匹敵するほど大きくなる長いコンテキストでは、これが利用可能な中で最大の節約手段であり、品質への影響もわずかです。

コンテキストを適正なサイズにする。 4,000トークンしか使わないのに128Kのコンテキストウィンドウを設定していると、事前確保型のランタイムではそれでもフルの代償を払うことになります。実際に使う分だけのコンテキストを設定してください。

MoEモデルを優先する。 すでに述べたとおり、MoEモデルは大きなモデル並みの品質を、小さなモデル並みの生成速度で提供してくれます。その代償となるのは容量ですが、それはまさにMacが他の選択肢よりも多く持っているものです。

投機的デコーディングを使う。 小さなドラフトモデルが複数のトークンを提案し、大きなモデルが1パスでそれをまとめて検証します。検証が並列に行われるため、これは帯域幅のボトルネックに直接切り込み、毎秒トークン数を大きく引き上げられます——代償は、2つ目の小さなモデルをメモリ上に保持することです。帯域幅が制約となっていて容量に余裕があるマシンでは、良いトレードオフです。

アプリを閉じる。 当たり前のことですが、それでも驚くほど有効な答えであることが多いです。タブを大量に開いたブラウザ、仮想マシン、動画編集ソフトはすべて同じメモリプールを奪い合っています。頼れる別枠のVRAMは存在しません。

よくある問題のトラブルシューティング

モデルはロードできるが、生成が極端に遅い

問題:macOSがGPUに渡す量を超えてしまい、処理がスワップに溢れています。症状としては、最初のトークンが出るまでに何秒もかかったり、生成がなめらかにストリーミングされず、途切れ途切れになったりします。

解決策:生成中にアクティビティモニタでメモリ圧迫の状況を確認してください。黄色や赤であれば、より軽い量子化を使う、コンテキストウィンドウを縮める、あるいはiogpu.wired_limit_mbを引き上げる(システム用に最低6〜8GBは残す)のいずれかを行ってください。圧迫が緑色なのにまだ遅い場合は、単純に帯域幅がボトルネックになっているだけで、解決策はより小さなモデルを使うことです。

「System has run out of application memory」

問題:多くの場合、ワイヤード上限を積極的に設定しすぎているか、長いセッションの中でコンテキストが大きく育ってしまっていることが原因です。

解決策:sudo sysctl iogpu.wired_limit_mb=0でリセットし、推論プロセスを再起動してください。それでもシステムの調子が戻らなければ再起動しましょう——この設定は永続化されないため、いずれにせよ再起動すればクリアされます。関連する原因については、メモリリークのトラブルシューティングガイドで扱っています。

計算上は収まるはずなのにロードに失敗する

問題:重みだけを基準にサイズを見積もり、KVキャッシュを見落としているか、ランタイムがコンテキストを段階的に拡張するのではなく、最初から全体を確保しています。

解決策:ランタイムの設定でコンテキスト長を下げて、もう一度試してください。32Kのコンテキストならロードできるのに128Kではロードできない場合、それが診断の裏付けになります。必要なコンテキストに対してどれだけの量が必要かは、容量のセクションの計算式から分かります。

長時間のセッションでMacが熱くなり、遅くなる

問題:継続的な推論は、GPUとメモリの両方に対する持続的な負荷です。ノート型はサーマルスロットリングを起こしますが、デスクトップ型はほとんど起こしません。

解決策:これは、この種の作業においてMacBookよりもMac miniやMac Studioを選ぶべき正当な理由の一つです——持続的な熱の余裕があるからです。ノート型を使っている場合は、MacBook Pro M5サーマルスロットリングガイドを参照してください。

プロンプト処理は速いのに、生成は遅い

問題:何も間違っていません。これはハードウェアの想定どおりの特性です。

解決策:上記のプリフィルとデコードの違いに関するセクションを参照してください。必要なのが生成速度であれば、解決策は、より小さなモデル、より積極的な量子化、アクティブパラメータ数の少ないMoEモデル、あるいはより高い帯域幅——コストの低い順に、この中から選ぶことになります。

よくある質問

70Bモデルを動かすにはどれだけのRAMが必要ですか?

4bit量子化での重みは約38.5GBです。コンテキストとオーバーヘッドを加えると、現実的な最低ラインとして搭載メモリ64GBが欲しいところです。なぜならmacOSがGPUに渡すのは、そのうちのおよそ42〜48GBだけだからです。搭載メモリ48GBでは、意味のあるコンテキストを含めた途端に窮屈になります。

2026年時点で、ローカルAIには16GBで十分ですか?

短いコンテキストでの4bit・8Bモデルであれば十分です。それより大きいものには不十分です。ローカルモデルを使うことがマシン購入の理由の一つであるなら、32GBを最低ラインとし、64GBを目標にしてください。

Neural EngineはローカルLLMを高速化しますか?

プロンプト処理には貢献しており、これがAppleの「LLMプロンプト処理が最大4.8倍高速」という数値の出どころです。M6のデュアル16コアNeural Engineは、実質的な進歩と言えます。しかしトークン生成における帯域幅の制約は変わりません。Mac上で人気のあるローカル推論ランタイムのほとんどは、主にMetal経由でGPUに依存しています。

512GBのMac Studioを買うべきですか?

容量が制約になっている場合に限ります。実際に動かすモデルが128GBに収まるなら、M5 Max Mac Studioでも3分の1の価格で同じ仕事ができます。なお、512GB構成は10月下旬まで出荷されず、フル構成にすると$18,299に達する点にも注意してください。

メモリを後から追加できますか?

できません。統合メモリは、すべてのApple Silicon Macにおいてチップパッケージの一部です。これは、後から見直すことが決してできない唯一のスペックであるため、余裕を持って多めに買う価値が最もあるスペックです。

この用途では、単体GPUを積んだPCよりMacの方が良いですか?

トレードオフが異なります。単体GPUはメモリ帯域幅ではるかに優れていますが、メモリ量ははるかに少なく——コンシューマー向けカードの上限は、Mac Studioが提供する量を大きく下回ります。Macは1ドルあたりの容量と消費電力で決定的に勝りますが、VRAMに収まるほど小さなモデルにおける純粋なスループットでは劣ります。あなたのモデルが大きいなら、Macが単体マシンとして唯一の選択肢になることも多いです。小さいなら、GPUの方が速いでしょう。

量子化は品質を損ないますか?

ほとんどの用途において、8bitはほぼ無損失です。4bitのK-quantは実用上のデフォルトであり、ほとんどのタスクで品質低下はわずかです。4bitを下回ると、品質は目に見えて落ちます。上記のメモリの表を踏まえると、8bitから4bitに落とすことでメモリ必要量はおおむね半分になります——通常はより小さなモデルに乗り換えるよりも良いトレードオフです。

まとめ

512GBという見出しは事実であり、ごく一部の人にとっては決定的な意味を持ちます。それ以外のほとんどの人にとって、この記事の実用的な要点は3行の計算に集約されます。重みはパラメータ数×パラメータあたりのバイト数、コンテキストはトークンあたり0.1〜0.5MBを上乗せ、そしてmacOSが購入したメモリのうちGPUに渡すのはおよそ65〜75%だけ、ということです。

実際に使うつもりのモデルにこの計算を当てはめると、答えはたいてい64GBに落ち着きます。次に2つ目の数値——帯域幅——を確認してください。それが、収まったモデルを実際に使い続けるかどうかを左右するからです。毎秒7トークンの32Bモデルと、毎秒24トークンの同じモデルとの差は、デモとツールの差であり、容量をいくら積んでもこの差は埋まりません。

どちらを選ぶにせよ、慎重に選んでください。それはハンダ付けされているのですから。

関連記事:Mac mini M6とMac Studio M5 Ultra:実際に何が変わったのか、Mac上のローカルAIアプリとあなたのデータの扱われ方、2026年、MacのRAM価格が上昇している。