Mac mini M4 для локальных LLM - реальная альтернатива видеокарте или хайп?

Теги: #GPU#LLM
Рейтинг: 37.6% · 5 голосов
Запуск больших языковых моделей локально: Llama, Mistral, Qwen, DeepSeek, Gemma. Квантизация GGUF, Ollama, llama.cpp, vLLM, LM Studio, выбор GPU и оптимизация инференса.
Аватара пользователя
nyrob
Сообщения: 7
Зарегистрирован: 22 май 2026, 08:12

Re: Mac mini M4 для локальных LLM - реальная альтернатива видеокарте или хайп?

Сообщение nyrob »

@roylrs, плюсую про MLX. На M3 Max qwen2.5-32b в 4bit у меня с llama.cpp было около 11 t/s, на mlx стало 15. Но prompt processing он не спасает, там чудес нет, архитектура такая.
👍1 ❤️2 🔥1 😄1 🤔
✔ Лучший ответ сформирован автоматически — roylrs
На 30к контекста ждёшь секунд 15-30 до начала ответа, против пары секунд на 4090. Если это RAG с постоянными длинными вводами - бесит. Если разовые вопросы - терпимо. MLX вместо llama.cpp немного ускоряет, попробуй обязательно.
Перейти к ответу →
Аватара пользователя
elixirlover
Сообщения: 19
Зарегистрирован: 21 май 2026, 04:05

Re: Mac mini M4 для локальных LLM - реальная альтернатива видеокарте или хайп?

Сообщение elixirlover »

а я бы просто взял б/у 3090 на авито за 65-70к и не выпендривался. Но у меня башня гудит в соседней комнате и всех бесит, так что мотивацию с маком понимаю хах
👍3 ❤️ 🔥1 😄1 🤔
Ответить
Поделиться темой: ✈ Telegram VK

Вернуться в «Локальные LLM и open-source модели»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость