Исследования

GreenBench: исследование энергоэффективности LLM на Apple Silicon M4 Pro

Автор: AI-Sphere· обновлено 1 сентября 2026 г. в 07:36· 5 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Что произошло

Исследователи представили фреймворк GreenBench для оценки энергоэффективности и углеродного следа инференса больших языковых моделей на Apple Silicon. В тестах использовался Mac с чипом M4 Pro и 48 ГБ объединённой памяти (unified memory). Для прямого измерения мощности применялась утилита macOS powermetrics, а для точного времени выполнения — Ollama с точностью до наносекунд.

Тестировались пять открытых моделей размером от 3 до 9 миллиардов параметров на трёх задачах обработки естественного языка. Измерения показали, что пакет процессора (CPU+GPU) потребляет всего 0,47 Вт во время инференса, а вся система — от 8 до 12 Вт. Для сравнения, датацентровые GPU в одиночном развёртывании тратят в 30–40 раз больше энергии на каждый сгенерированный токен.

Модели с меньшим числом параметров (3–3,8 млрд) обеспечивали в 2,6–4,2 раза большую пропускную способность (токенов в секунду) и при этом незначительно выигрывали в энергопотреблении.

Почему это важно

Рост популярности LLM сопровождается озабоченностью их воздействием на окружающую среду. Большинство исследований Green AI сосредоточено на датацентровых GPU или встроенных платформах, а энергопрофиль Apple Silicon оставался неизученным. Результаты GreenBench частично заполняют этот пробел.

Редакционный анализ: 0,47 Вт — это на порядок меньше, чем у типичных потребительских GPU, и сопоставимо с энергопотреблением некоторых микроконтроллеров. Это означает, что Apple Silicon может стать привлекательной платформой для локального инференса LLM, особенно в сценариях, где важны низкое энергопотребление и автономность. Однако важно учитывать, что тесты проводились в однопользовательском режиме; в датацентрах с параллельными запросами эффективность может отличаться.

Что это даёт пользователю

Практические сценарии на основе подтверждённых возможностей:

  • Разработчики могут запускать открытые LLM (например, модели 3–9B) на MacBook или Mac Mini с минимальным энергопотреблением для прототипирования, локальных чат-ботов и задач обработки текста без доступа к облаку.
  • Энергоэффективность позволяет использовать ноутбук без активного охлаждения и длительное время от батареи, что удобно для полевой работы, обучения или демонстраций.
  • Меньшие модели (3–3,8B) дают лучшую пропускную способность и могут быть предпочтительны для приложений, где важна скорость ответа, а не максимальное качество.

Что пока неизвестно

Пока нет данных о производительности на более мощных конфигурациях Apple Silicon (M4 Max, Ultra), о масштабировании при многопользовательской нагрузке, а также о сравнении с другими архитектурами, такими как x86 с дискретной графикой или Qualcomm Snapdragon. Исследование опубликовано в виде препринта arXiv и не прошло рецензирование, поэтому результаты могут быть уточнены.

Источники

#GreenBench#Apple Silicon#energy efficiency#LLM inference

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат