GPU

Сколько видеопамяти реально нужно — вечный вопрос: влезет ли 32B-модель в 24 гигабайта на 3090 и слышна ли разница между Q4_K_M и Q5_K_M, или это плацебо. В разделе обсуждают железо под нейросети — от б/у видеокарт до Mac mini M4, делятся опытом борьбы с недетерминизмом в PyTorch и разбирают, почему локальная LLM падает в проде. Поможет тем, кто выбирает карту под инференс или обучение и не хочет переплачивать.

21 тем, 220 ответов, 11587 просмотров · все теги

Похожие теги: llama.cpp 4Qwen 3LLM 3C++ 2vLLM 2Ollama 2pytorch 2инфраструктура 2Flux 1windows 1инференс 1cuda 1оптимизация 1serverless 1gcp 1
  • Темы
Популярные запросы по теме: как запустить llama локальноqwen vs llama что лучшекак запустить deepseek локальноmistral для локального запуска отзывычто такое linux и чем он отличается от windows · все запросы →