Сколько памяти Mac нужно для запуска локальных LLM?

macOSTahoe ·
Сколько памяти Mac нужно для запуска локальных LLM?

Единая память определяет, какие модели загрузятся. Пропускная способность — как быстро они отвечают. Вот арифметика для каждого Mac 2026 года, вплоть до Mac Studio на 512 ГБ.

Новый Mac Studio от Apple достигает максимума в 512 ГБ единой памяти. В прессе это подают так, будто на стол теперь можно поставить модели уровня frontier. В целом это верно, и в то же время это ответ на вопрос, который большинство покупателей Mac даже не задают.

Вопрос, который задают они, уже и полезнее: при том, что я хочу запускать, сколько памяти мне на самом деле нужно купить? Единая память впаяна в корпус чипа. У вас есть один шанс ответить на этот вопрос — при оформлении заказа, на весь срок службы машины.

Хорошая новость в том, что это арифметика, а не вопрос мнения. Эта статья и есть эта арифметика.

Ключевые выводы

  • Всё решают два числа. Объём памяти определяет, загрузится ли модель вообще. Пропускная способность памяти определяет, как быстро она генерирует текст. Они независимы, и машина может быть сильна в одном и слаба в другом.
  • Оценивайте вес модели как параметры × байт на параметр. При 4-битном квантовании это примерно 0.55 байта на параметр, поэтому модели 70B нужно около 38 ГБ до учёта контекста.
  • macOS не позволяет GPU использовать всю вашу RAM. Есть недокументированный потолок, управляемый iogpu.wired_limit_mb. На Mac с 32 ГБ вы не получаете 32 ГБ под модель.
  • Заглавные цифры Apple про ИИ описывают обработку промпта, а не генерацию текста. У них разные узкие места. Внимательно читайте формулировки.
  • Объём памяти M5 Ultra — не новость. M3 Ultra уже предлагал 512 ГБ в 2025 году. Изменилась пропускная способность: с 819 ГБ/с до 1.2 ТБ/с.

Два числа

Почти каждое неудачное решение о покупке Mac для ИИ происходит из-за того, что эти два числа схлопывают в одно.

Объём — это стена. Если модель вместе с контекстом не помещается в память, она не запустится. На Apple silicon нет плавной деградации, как у дискретной GPU, которая может вытеснять данные в системную RAM, — на Mac единая память и есть системная RAM, и как только вы превышаете то, что macOS готова отдать GPU, вы либо не загружаетесь, либо откатываетесь к чему-то значительно более медленному.

Пропускная способность — это ограничение скорости. Чтобы сгенерировать один токен, плотная модель считывает весь набор своих весов из памяти. Каждый токен. Это значит, что теоретический потолок скорости генерации — это пропускная способность памяти, делённая на размер модели, и никакое количество ядер GPU этого не изменит.

Именно поэтому машина может вместить модель на 200 ГБ и при этом ощущаться непригодной для использования, и именно поэтому маленькая модель на скромной машине может казаться мгновенной.

Объём: что помещается

Веса — доминирующая статья затрат, и они предсказуемы:

memory for weights ≈ parameters × bytes per parameter

Число байт на параметр зависит от квантования:

ТочностьБайт на параметрТипичное применение
FP16 / BF162.0Обучение, максимальная точность
8-bit (Q8)~1.0Инференс почти без потерь
4-bit (Q4_K_M)~0.55Практический стандарт по умолчанию
3-bit~0.42Заметная потеря качества

4-битные K-кванты в среднем чуть выше 4 бит, если учесть метаданные масштабирования, поэтому честная цифра — 0.55, а не 0.50. Применяем это:

Размер модели4-bit8-bitFP16
8B4.4 GB8 GB16 GB
14B7.7 GB14 GB28 GB
32B17.6 GB32 GB64 GB
70B38.5 GB70 GB140 GB
120B66 GB120 GB240 GB
235B129 GB235 GB—
400B220 GB400 GB—
671B369 GB671 GB—

Затем добавьте контекст

KV-кеш хранит ключи и значения внимания для каждого токена разговора и растёт линейно с длиной контекста. Его размер на токен сильно варьируется от архитектуры к архитектуре — модели с grouped-query attention здесь заметно дешевле старых конструкций, — но рабочий диапазон составляет от 0.1 МБ до 0.5 МБ на токен.

При контексте в 32 000 токенов это примерно от 3 ГБ до 16 ГБ сверх весов. При 128 000 токенов кеш может превысить размер самой модели.

Это самая распространённая причина, по которой модель, которая «должна поместиться», не помещается. Если вы планируете скармливать ей длинные документы или вести долгие разговоры, закладывайте это в бюджет явно, а не считайте только веса и не надейтесь на удачу.

Практическое правило

memory you need ≈ (weights) + (KV cache for your context) + 2–3 GB overhead

А затем сверьте это с тем, что macOS реально вам даст, — а это не то число, что написано на коробке.

Потолок, о котором никто не упоминает

macOS резервирует единую память для системы и ограничивает, сколько GPU может «закрепить» (wire). Рычаг управления — это sysctl:

$ sysctl iogpu.wired_limit_mb
iogpu.wired_limit_mb: 0

Ноль означает «автоматически». Apple не документирует, во что это автоматическое значение разрешается, и я не собираюсь придумывать формулу — но замеры сообщества стабильно показывают что-то около 65–75% от общего объёма памяти, при этом более крупным машинам позволяется большая доля.

Практическое следствие для машин, которые вы можете купить:

Установленная памятьПримерно доступно GPU
16 GB~10–12 GB
32 GB~21–24 GB
64 GB~42–48 GB
128 GB~85–96 GB
512 GB~340–384 GB

Вы можете поднять этот предел. Изменение применяется немедленно и не переживает перезагрузку:

# Allow the GPU to wire 28GB on a 32GB Mac
sudo sysctl iogpu.wired_limit_mb=28672

# Back to automatic
sudo sysctl iogpu.wired_limit_mb=0

Будьте с этим осторожны. Всё, что вы забираете, вы забираете у операционной системы и у всех остальных приложений. Подведёте предел слишком близко к общему объёму — получите свопинг, «пляжный мяч» или принудительное завершение из-за нехватки памяти, а на Mac с быстрым SSD свопинг под давлением памяти — это ещё и устойчивая нагрузка на запись. Если вы видели диалог System has run out of application memory, вот один из способов до него добраться.

Разумный потолок — это общий объём памяти минус 6–8 ГБ на macOS и другие ваши приложения. Установите его, запустите модель и наблюдайте за давлением памяти в Мониторе активности. Если вы вообще часто видите скачки давления памяти, наше руководство по управлению памятью Mac разбирает диагностику.

Объём памяти против пропускной способности

Пропускная способность: как быстро он отвечает

Вот оценка, которая имеет значение, и вот что она собой представляет:

tokens per second ≈ (memory bandwidth × efficiency) ÷ weight size in bytes

Эффективность учитывает разрыв между пиковой теоретической пропускной способностью и тем, чего реально достигает движок инференса, — на Apple silicon с хорошо оптимизированным рантаймом это примерно 0.6–0.8. Ниже я использую 0.7.

Это расчётные оценки на основе опубликованных цифр пропускной способности, а не бенчмарки, которые я запускал сам. Относитесь к ним как к верному порядку величины и верному относительному порядку, а не как к измерениям. Реальные цифры варьируются в зависимости от рантайма, квантования, длины контекста и теплового поведения.

Скорость генерации для плотной (dense) модели при 4-bit:

M6 (170GB/s)M5 Pro (307GB/s)M5 Max (614GB/s)M5 Ultra (1.2TB/s)
8B (4.4GB)~27 tok/s~49 tok/s~98 tok/s~190 tok/s
32B (17.6GB)~7 tok/s~12 tok/s~24 tok/s~48 tok/s
70B (38.5GB)не помещается~6 tok/s~11 tok/s~22 tok/s
120B (66GB)не помещаетсяне помещается~7 tok/s~13 tok/s

Для ориентира: комфортная скорость чтения — около 10 токенов в секунду. Ниже примерно 5 большинство людей перестают этим пользоваться.

Посмотрите на строку 32B. Это одна и та же модель, и по всему модельному ряду она проходит путь от едва терпимой до по-настоящему быстрой — при этом «помещается ли она» не меняется. Это пропускная способность, а не объём, и это та ось, о которой забывают, покупая самую дешёвую машину, технически вмещающую модель.

Почему MoE-модели меняют ответ

Модели mixture-of-experts (MoE) нарушают правило выше, и именно поэтому машина на 512 ГБ вообще интересна.

MoE-модель хранит множество экспертных подсетей, но активирует лишь несколько на каждый токен. Модель 235B с 22B активных параметров должна хранить веса на все 235B, но считывает для генерации каждого токена лишь около 22B.

Итак:

  • Объём определяется общим числом параметров — 129 ГБ при 4-bit.
  • Скорость определяется числом активных параметров — как у плотной модели 22B, то есть примерно 40 tok/s на M5 Ultra, а не ~9 tok/s, которые выдала бы плотная модель 235B.

Это та асимметрия, которая делает крупные MoE-модели практичными на Apple silicon так, как они не практичны на потребительской GPU: вам нужен объём, который Apple продаёт так, как никто больше по этой цене не продаёт, а взамен вы получаете скорость, пропорциональную гораздо меньшей модели.

Именно поэтому фраза «512 ГБ запускает frontier-модели» верна, но неполна. Она запускает разреженные frontier-модели на приемлемой скорости. Гипотетическая плотная модель 400B при 4-bit заняла бы 220 ГБ и генерировала бы около 4 токенов в секунду на M5 Ultra. Она поместится. Вам это не понравится.

Обработка промпта — это другая задача

Прочитайте формулировки Apple про новый Mac mini внимательно:

Up to 4.8x faster LLM prompt processing versus M4 Up to 13.5x faster LLM prompt processing versus M1

Обработка промпта — prefill — это фаза, на которой модель поглощает то, что вы ей дали. Каждый токен вашего ввода обрабатывается параллельно, что делает эту фазу compute-bound (ограниченной вычислениями): она масштабируется вместе с пропускной способностью GPU, с Neural Accelerators, теперь встроенными в каждое ядро GPU, и на M6 — с первым в истории Apple сдвоенным Neural Engine.

Генерация токенов — decode — происходит по одному токену за раз, и каждый требует полного прохода по весам. Это bandwidth-bound (ограничено пропускной способностью), и никакое количество вычислительной мощности этого не исправит.

Apple выбрала для рекламы именно ту, вычислительно-ограниченную половину. Это не вводит в заблуждение — это действительно та половина, что улучшилась больше всего в этом поколении. Но это значит, что маркетинговые цифры описывают, как быстро машина прочитает ваш 50-страничный документ, а не то, как быстро она напишет резюме.

Что из этого важно для вас, зависит от вашей работы:

  • Длинный ввод, короткий вывод — суммаризация документов, классификация, извлечение из кодовой базы — доминирует prefill. Цифры Apple применимы.
  • Короткий ввод, длинный вывод — черновики, чат, генерация кода — доминирует decode. Ваше число — это пропускная способность.
  • Длинный ввод и длинный вывод — агентные сценарии над большим контекстом — нужно и то, и другое, плюс объём под KV-кеш.

Что на самом деле изменилось в M5 Ultra

Часть материалов о запуске подразумевала, что держать frontier-модель на десктопе — это что-то новое. Это не так, и если разобраться в этом правильно, это меняет решение об апгрейде для всех, у кого уже есть Mac Studio.

M3 Ultra (2025)M5 Ultra (2026)
Максимальный объём единой памяти512GB512GB
Пропускная способность памяти819GB/s1.2TB/s
Ядра GPUдо 80до 80
Ядра CPU32до 36

Объём не изменился. Число ядер GPU не изменилось. Пропускная способность выросла примерно в 1.47 раза, а CPU получил четыре дополнительных ядра.

Это точно согласуется с собственными сравнениями Apple с M3 Ultra — «до 1.3x выше многопоточная производительность» и «до 1.8x быстрее графика» — скромные цифры, а главная заявка Apple, «до 4.3x пиковая производительность ИИ-вычислений», происходит от Neural Accelerators, теперь встроенных в каждое ядро GPU, а не от большего числа ядер или ядер большего размера.

Так что конкретно для локального инференса:

  • Скорость генерации улучшается примерно пропорционально пропускной способности — назовём это ростом примерно в 1.4 раза на одной и той же модели.
  • Обработка промпта улучшается значительно сильнее, в русле той самой цифры 4.3x по ИИ-вычислениям.
  • То, что вы можете загрузить, не изменилось.

Если у вас уже есть Mac Studio на базе M3 Ultra с 512 ГБ, и ваше ограничение — какие модели помещаются, это поколение не решает проблему, которая у вас есть. Если ваше ограничение — ожидание обработки длинных промптов, оно решает это напрямую. Наше руководство по производительности Mac Studio M4 Max и M3 Ultra подробно разбирает предыдущее поколение.

Ещё одна деталь по срокам, которую стоит знать перед заказом: конфигурация на 512 ГБ не поступит в продажу 22 сентября вместе со всем остальным. По данным Apple, она появится в конце октября.

Выбор конфигурации Mac для локального ИИ

Какую машину выбрать, исходя из того, чем вы реально занимаетесь

16 ГБ — не для этого

У вас есть примерно 10–12 ГБ, доступных GPU. Это тянет модели 8B при 4-bit со скромным контекстом и ничего крупнее. Это нормально для моделей класса автодополнения и небольших локальных ассистентов, а во всём остальном будет только раздражать. В 2026 году 16 ГБ — это машина, которая хорошо делает другие вещи и запускает LLM попутно.

32 ГБ (M6 Mac mini, максимальная конфигурация — $1,299) — точка входа

Около 21–24 ГБ в вашем распоряжении. Это комфортно тянет модели 8B и 14B, а модель 32B при 4-bit с коротким контекстом идёт со скоростью около 7 токенов в секунду. Эта последняя цифра — честный предел: модель помещается, но на грани комфорта.

Подходит для: локальных ассистентов кодирования, работы с приватными документами, изучения инструментов. Апгрейд за $400 с 16 ГБ не опционален, если локальные модели — одна из причин, по которой вы покупаете эту машину.

64 ГБ (M5 Pro Mac mini — от $1,699) — золотая середина для большинства

Около 42–48 ГБ доступно, и 307 ГБ/с пропускной способности. Модель 70B при 4-bit помещается с запасом под реальный контекст, генерируя около 6 токенов в секунду — пригодно для пакетной работы, медленно для интерактивного чата. Модель 32B работает со скоростью примерно 12 токенов в секунду, что комфортно.

Именно здесь оказывается большинство серьёзных сценариев использования локальных моделей, и это конфигурация, на которую я бы посоветовал смотреть большинству людей. Она также даёт Thunderbolt 5, которого нет у mini на M6.

128 ГБ (M5 Max Mac Studio — от $2,499) — профессиональный уровень

Около 85–96 ГБ доступно при 614 ГБ/с. 70B при 4-bit работает со скоростью примерно 11 токенов в секунду — комфортно интерактивно. Модели класса 120B помещаются. Среднеразмерные MoE-модели становятся практичными.

Это конфигурация для тех, чья работа ежедневно зависит от локального инференса, — пропускная способность здесь примерно вдвое выше скорости генерации M5 Pro на той же модели.

512 ГБ (M5 Ultra Mac Studio — от $5,499, свыше $18,000 в максимальной конфигурации) — объём, который больше нигде не купить

Около 340–384 ГБ доступно при 1.2 ТБ/с. Это вмещает MoE-модели класса 400B при 4-bit и генерирует со скоростью, соответствующей числу их активных параметров, — а это именно то, чего никакой другой десктоп по этой цене не предлагает.

Покупайте это, если вы упираетесь именно в объём, и ничто другое эту проблему не решает. Если ваши модели помещаются в 128 ГБ, Ultra покупает вам скорость, которую можно получить гораздо дешевле.

Если вы не покупаете новый Mac

Существующий Mac на M1/M2/M3/M4 с достаточным объёмом памяти прекрасно запускает локальные модели — пропускная способность на уровнях Pro и Max была хорошей уже несколько поколений подряд. Проверьте свои собственные цифры:

# Total memory in GB
echo "$(( $(sysctl -n hw.memsize) / 1073741824 )) GB"

# Chip and current GPU wired limit
sysctl -n machdep.cpu.brand_string
sysctl iogpu.wired_limit_mb

Затем примените таблицы выше. Mac на 64 ГБ с M1 Max при 400 ГБ/с — вполне достойная машина для локального инференса, и всегда ею была.

Разобранный пример

По абстрактным таблицам легко кивать, но трудно действовать. Вот та же логика, применённая к одному конкретному случаю.

Требование: приватный ассистент для кодирования, который читает кодовую базу умеренного размера, держит контекст в 32 000 токенов и отвечает интерактивно. Вам нужна модель класса 32B, потому что модели меньше заметно хуже справляются с кодом.

Шаг 1 — веса. 32B при 4-bit: 32 × 0.55 = 17.6 ГБ.

Шаг 2 — контекст. 32 000 токенов при примерно 0.2 МБ на токен для современной модели с grouped-query attention: около 6.4 ГБ. Это тот член уравнения, о котором забывают, и здесь он составляет больше трети размера весов.

Шаг 3 — накладные расходы. Рантайм, буферы Metal, токенизатор: 2–3 ГБ.

Итого: примерно 26–27 ГБ, которые должны быть закреплены (wired) для GPU.

Шаг 4 — перевод в установленную память. При автоматическом потолке около 70%, 27 ГБ закреплённой памяти требуют примерно 38 ГБ установленной. Mac на 32 ГБ автоматически даёт вам 21–24 ГБ — недостаточно. Вы могли бы поднять iogpu.wired_limit_mb до 27 ГБ на машине с 32 ГБ, что оставляет 5 ГБ на macOS и всё остальное. Это будет работать, пока ничего больше не запущено, и развалится в тот момент, когда вы откроете браузер.

Вывод: нужно 64 ГБ установленной памяти. Это укладывается в Mac mini на M5 Pro, а не в M6.

Шаг 5 — проверка скорости. 307 ГБ/с × 0.7 ÷ 17.6 ГБ ≈ 12 токенов в секунду. Комфортно для интерактивного использования.

Теперь измените одну переменную. Оставьте всё остальное как есть и запросите контекст в 128 000 токенов: KV-кеш вырастет примерно до 25 ГБ, общая потребность — примерно до 45 ГБ, а требуемая установленная память — до 64 ГБ минимум с поднятым потолком закрепления, или до 128 ГБ для комфорта. Одна настройка сдвинула ответ на целый уровень продуктовой линейки.

Это и есть весь метод. Веса, контекст, накладные расходы, делим на потолок, затем сверяем пропускную способность с размером весов.

Рантаймы ведут себя по-разному

Арифметика выше описывает железо. То, что вы реально наблюдаете, зависит от софта, и различия достаточно велики, чтобы повлиять на решение о покупке.

MLX — это собственный фреймворк массивов от Apple, построенный под единую память. Он не копирует данные между «памятью CPU» и «памятью GPU», потому что на Apple silicon такого разделения не существует, и в целом это самый эффективный по памяти вариант на Mac. Если вы покупаете железо специально под локальный инференс, именно инструментарий на базе MLX показывает это железо с лучшей стороны.

llama.cpp и инструменты, построенные на нём, — самый переносимый вариант с отличной поддержкой Metal. Его форматы квантования — семейство Q4_K_M, которое предполагают таблицы выше, — являются фактическим стандартом, а его поведение по памяти предсказуемо и хорошо задокументировано.

Ollama оборачивает llama.cpp управлением моделями. Удобно, и важно знать, что он держит модели в памяти после использования в течение настраиваемого периода. Если вы близко к своему потолку, модель, с которой вы закончили час назад, может всё ещё занимать память. Это частая причина фразы «вчера же работало».

LM Studio — графический вариант, честно показывающий память: что поместится, а что нет, ещё до загрузки. Это хороший способ развить интуицию для этих цифр без ручных вычислений.

Два поведения важны независимо от того, что вы используете:

  1. Предвыделяется ли KV-кеш заранее. Некоторые рантаймы резервируют всё окно контекста в момент загрузки; другие наращивают его по мере разговора. Предвыделение означает, что модель, которая на практике бы заработала, не загрузится. Если модель отказывается загружаться при 128K, но загружается при 8K, вот в чём причина — и решение здесь в том, чтобы снизить настроенный контекст, а не брать модель поменьше.
  2. Выгружаются ли неиспользуемые модели. Проверьте настройку keep-alive вашего рантайма, прежде чем делать вывод, что ваша машина слишком слаба.

Как купить запас без покупки памяти

Прежде чем тратить $400 на более высокий уровень памяти, есть несколько приёмов, которые меняют арифметику.

Квантуйте жёстче. Переход с 8-bit на 4-bit вдвое сокращает требования к памяти при умеренной потере качества. Это почти всегда более выгодный обмен, чем переход на модель меньшего размера с более высокой точностью — модель 32B при 4-bit, как правило, превосходит модель 14B при 8-bit при похожем объёме памяти.

Квантуйте KV-кеш. Большинство рантаймов умеют хранить KV-кеш при 8-bit или ниже. На длинных контекстах, где кеш соперничает по размеру с весами, это самая большая доступная экономия при небольшой цене за качество.

Подбирайте размер контекста под задачу. Окно контекста в 128K, из которого вы используете 4 000 токенов, всё равно стоит полную цену в рантаймах с предвыделением. Настраивайте контекст под то, что вы реально используете.

Предпочитайте MoE-модели. Как уже разобрано выше, модель mixture-of-experts даёт вам качество крупной модели при скорости генерации маленькой. Цена этого — объём памяти, а это как раз то, чего у Mac больше, чем у альтернатив.

Используйте спекулятивное декодирование. Маленькая модель-черновик предлагает несколько токенов, а крупная модель проверяет их за один проход. Поскольку проверка параллельна, это напрямую атакует узкое место пропускной способности и может ощутимо поднять число токенов в секунду — ценой хранения в памяти второй, маленькой модели. На машине, ограниченной по пропускной способности, но с запасом по объёму, это хороший обмен.

Закрывайте лишнее. Очевидно, и всё равно на удивление часто это и есть ответ. Браузеры с множеством вкладок, виртуальные машины и видеоредакторы — все они соревнуются за один и тот же пул памяти. Отдельной VRAM, на которую можно переключиться, здесь нет.

Решение частых проблем

Модель загружается, но генерация крайне медленная

Проблема: вы превысили то, что macOS готова отдать GPU, и работа уходит в своп. Симптомы — первый токен, который приходит через много секунд, и генерация, которая заикается, а не течёт равномерно.

Решение: проверьте давление памяти в Мониторе активности во время генерации. Если оно жёлтое или красное, используйте квантование пониже, уменьшите окно контекста или поднимите iogpu.wired_limit_mb — оставив системе как минимум 6–8 ГБ. Если давление зелёное, а скорость всё равно низкая, вы просто упираетесь в пропускную способность, и решение — модель поменьше.

"System has run out of application memory"

Проблема: обычно это слишком агрессивно выставленный предел закрепления (wired limit) или большой контекст, разросшийся за долгую сессию.

Решение: сбросьте настройку командой sudo sysctl iogpu.wired_limit_mb=0 и перезапустите процесс инференса. Перезагрузите систему, если она остаётся «недовольной», — настройка не сохраняется между сессиями, так что перезагрузка в любом случае её сбросит. Смежные причины разобраны в нашем руководстве по устранению утечек памяти.

На бумаге всё помещается, но загрузка не удаётся

Проблема: вы посчитали только веса и забыли про KV-кеш, либо рантайм выделяет весь контекст заранее, а не наращивает его.

Решение: снизьте длину контекста в настройках рантайма и попробуйте снова. Если контекст в 32K загружается, а 128K — нет, это подтверждает диагноз, а арифметика из раздела про объём подскажет, сколько памяти вам нужно под желаемый контекст.

Mac греется и замедляется за долгую сессию

Проблема: устойчивый инференс — это устойчивая нагрузка и на GPU, и на память. Ноутбуки троттлят. Десктопы — в основном нет.

Решение: это один из реальных аргументов в пользу Mac mini или Mac Studio против MacBook для такой нагрузки — устойчивый тепловой запас. Если речь о ноутбуке, см. наше руководство по тепловому троттлингу MacBook Pro M5.

Быстрая обработка промпта, медленная генерация

Проблема: всё в порядке. Это ожидаемая форма поведения железа.

Решение: см. раздел выше про prefill и decode. Если вам важна именно скорость генерации, решение — модель поменьше, более агрессивное квантование, MoE-модель с небольшим числом активных параметров или больше пропускной способности — именно в таком порядке по стоимости.

Часто задаваемые вопросы

Сколько RAM нужно для запуска модели 70B?

При 4-битном квантовании веса занимают около 38.5 ГБ. Добавьте контекст и накладные расходы, и реалистичный минимум — 64 ГБ установленной памяти, потому что macOS отдаст GPU лишь примерно 42–48 ГБ из этого объёма. 48 ГБ установленной памяти уже слишком тесно, как только вы добавляете сколько-нибудь значимый контекст.

Достаточно ли 16 ГБ для локального ИИ в 2026 году?

Для моделей 8B при 4-bit с коротким контекстом — да. Для всего более крупного — нет. Если локальные модели — одна из причин покупки машины, считайте 32 ГБ полом, а 64 ГБ — целью.

Ускоряет ли Neural Engine локальные LLM?

Он вносит вклад в обработку промпта — именно отсюда берётся цифра Apple «в 4.8 раза быстрее LLM prompt processing», и сдвоенный 16-ядерный Neural Engine в M6 — это реальный шаг вперёд. Он не меняет ограничение по пропускной способности при генерации токенов. Большинство популярных рантаймов для локального инференса на Mac опираются в первую очередь на GPU через Metal.

Стоит ли покупать Mac Studio на 512 ГБ?

Только если вы упираетесь именно в объём памяти. Если модели, которые вы реально используете, помещаются в 128 ГБ, Mac Studio на M5 Max делает ту же работу за треть цены. Также учтите, что конфигурация на 512 ГБ не поступит в продажу до конца октября, а полностью укомплектованная машина доходит до $18,299.

Можно ли добавить память позже?

Нет. Единая память — часть корпуса чипа на каждом Mac с Apple silicon. Это спецификация, которую больше всего стоит покупать с запасом, потому что это единственная спецификация, к которой вы никогда не сможете вернуться.

Mac лучше, чем ПК с дискретной GPU, для этой задачи?

Разные компромиссы. Дискретная GPU обладает намного более высокой пропускной способностью памяти, но гораздо меньшим объёмом памяти — потребительские карты достигают потолка значительно ниже того, что предлагает Mac Studio. Mac уверенно выигрывает по объёму памяти на доллар и по энергопотреблению, и проигрывает по чистой пропускной способности на моделях, достаточно маленьких, чтобы поместиться в VRAM. Если ваши модели крупные, Mac часто оказывается единственным вариантом «в одной коробке». Если они маленькие — GPU быстрее.

Вредит ли квантование качеству?

8-bit близок к варианту без потерь для большинства задач. 4-битные K-кванты — практический стандарт по умолчанию, и деградация для большинства задач умеренная. Ниже 4-bit качество заметно падает. Судя по таблицам памяти выше, переход с 8-bit на 4-bit примерно вдвое сокращает требования к памяти — обычно это более выгодный обмен, чем переход на модель меньшего размера.

Заключение

Заголовок про 512 ГБ — это реальность, и для небольшого числа людей она решающая. Для всех остальных полезная версия этой статьи умещается в три строчки арифметики: веса — это параметры, умноженные на байты на параметр, контекст добавляет сверху 0.1–0.5 МБ на токен, а macOS отдаёт GPU лишь около 65–75% от того, что вы купили.

Прогоните эти числа для моделей, которые вы реально собираетесь использовать, и ответ обычно приземляется на 64 ГБ. Затем проверьте второе число — пропускную способность, — потому что именно оно решает, останетесь ли вы пользоваться моделью, которая поместилась. Разрыв между моделью 32B на скорости 7 токенов в секунду и той же моделью на скорости 24 токена в секунду — это разрыв между демо и рабочим инструментом, и никакой объём памяти его не закрывает.

И что бы вы ни выбрали, выбирайте внимательно. Это впаяно намертво.

Похожие материалы: Mac mini M6 и Mac Studio M5 Ultra: что реально изменилось, локальные ИИ-приложения на Mac и что они делают с вашими данными, а также цены на память Mac растут в 2026 году.