Решённые вопросы — Локальные LLM и open-source модели
Решённые вопросы раздела «Локальные LLM и open-source модели»: 47 тем с принятым лучшим ответом — готовые проверенные решения сообщества по этой теме.
По разделам:
все
Карьера в IT 56AI-ассистированная разработка 55Локальные LLM и open-source модели 47Нейрогенерация: изображения и видео 37Веб-разработка 36Self-hosting и Homelab 29DevOps и CI/CD 28Геймдев и разработка игр 27Языки программирования 26Курилка и оффтоп 26Кибербезопасность и пентест 26Сборка ПК и комплектующие 25Базы данных 24Смартфоны и гаджеты 24Машинное обучение и Data Science 23Новости технологий 22Стартапы и фриланс 22Облачные платформы 19Linux и системное администрирование 18Одноплатники, IoT и DIY-электроника 18Приватность и шифрование 18CTF и реверс-инжиниринг 18Мобильная разработка 17Статьи и лонгриды 1
- Вопросы с решением (47)
-
- Заявленные 256к контекста оказались фикцией, после 40к модель не помнит начало ✓ Лучший ответОтвет (lonelygoblin): подниму. думал, я один такой, у меня после 50к в ролеплее персонаж забывает, кто он. теперь хоть понятно почемув «Локальные LLM и open-source модели» · 7 ответов · 63 просмотров
-
- Q4 против Q8 в GGUF - реально ли видно деградацию или это плацебо? ✓ Лучший ответОтвет (KafkaAndy): Я гоняла Qwen2.5-Coder 14B на генерации SQL. Q8 и Q6 практически идентичны, Q4_K_M начинает иногда путать имена колонок на длинных схемах. На простых запросах разницы…в «Локальные LLM и open-source модели» · 11 ответов · 2397 просмотров
-
- Ollama как настроить системный промпт и параметры генерации ✓ Выбран авторомОтвет (ansible777): Полный пример рабочего Modelfile для кодинг-ассистента, которым сам пользуюсь: FROM llama3.1:8b — затем PARAMETER temperature 0.2 (низкая для кода — меньше…в «Локальные LLM и open-source модели» · 6 ответов · 71 просмотров
-
- GPU в простое жрёт VRAM и 70 ватт, хотя ничего не крутится ✓ Лучший ответОтвет (sleepyraccoon): Нормально. Ollama держит модель в памяти keep_alive по дефолту 5 минут чтобы не перегружать на следующий запрос. Поставь OLLAMA_KEEP_ALIVE=0 или нужное время если…в «Локальные LLM и open-source модели» · 4 ответов · 339 просмотров
-
- Неделю дебажил 'тупую' модель, а это Ollama резала контекст до 2048 ✓ Лучший ответОтвет (fpga_lord): Классика. Ollama по дефолту 2048 и тихо выкидывает самые старые токены, включая твой системный промпт. Ставь num_ctx явно в Modelfile или через параметр запроса.в «Локальные LLM и open-source модели» · 6 ответов · 549 просмотров
-
- Ollama не видит GPU на Windows 11 что делать ✓ Выбран авторомОтвет (nixos69): Развёрнуто отвечу, потому что сам с этим провозился полдня. Проблема чаще всего в одном из трёх: 1) Ollama запущена не как сервис, а как обычный процесс без прав на…в «Локальные LLM и open-source модели» · 6 ответов · 73 просмотров
-
- Вышли новые веса, есть ли смысл обновляться или старая модель и так норм ✓ Лучший ответОтвет (sleepypanic): я наоборот люблю щупать всё новое сразу, интересно же. но в прод не тащу пока не отлежится, для работы старая проверенная. для баловства новьё, для дела стабильностьв «Локальные LLM и open-source модели» · 8 ответов · 64 просмотров
-
- Взял две Mi50 по 32 гига с али под локалки, неделя с ROCm и я почти сдался ✓ Лучший ответОтвет (allenw): Shonroman писал(а):через год llama.cpp дропнет gfx906 вслед за амд и у тебя 64 гига мертвого кремния С чего бы. Вулкан бэкенд от воли амд не зависит вообще, это обычный…в «Локальные LLM и open-source модели» · 6 ответов · 62 просмотров
-
- vLLM vs llama.cpp что выбрать для продакшн инференса ✓ Выбран авторомОтвет (nashnet): Из практики: vLLM на Qwen2.5-72B с --tensor-parallel-size 4 и bfloat16 на 4xA100 даёт около 1200-1500 токенов/сек суммарного throughput при batching. TTFT (time to…в «Локальные LLM и open-source модели» · 9 ответов · 81 просмотров
-
- AWQ или GPTQ для vLLM в 2026, и причём тут вообще GGUF ✓ Лучший ответОтвет (middlewarlock): Коротко: GGUF в vLLM поддерживается, но это не его родной путь, скорость хуже. Для vLLM бери AWQ (4 бит) если есть готовый квант, он обычно чуть качественнее GPTQ на…в «Локальные LLM и open-source модели» · 8 ответов · 485 просмотров
-
- Перестаньте советовать vLLM всем подряд, это не замена llama.cpp ✓ Лучший ответОтвет (Omoto): А я наоборот ушёл с llama.cpp server на vLLM даже для себя, потому что мне нужен нормальный OpenAI-совместимый API с function calling из коробки. У llama.cpp server это…в «Локальные LLM и open-source модели» · 14 ответов · 658 просмотров
-
- Франкен-4090 на 48 гигов с авито против двух 3090, кто реально владел? ✓ Лучший ответОтвет (burneddeadlock): Pudakris писал(а):турбина орет как пылесос, 75 дцб под нагрузкой это кстати решаемо, люди перекидывают их на водянку от 3090 turbo, крепеж совпадает, плюс 15к и тишина…в «Локальные LLM и open-source модели» · 3 ответов · 46 просмотров
-
- MoE модели на проце с большим RAM реально работают или маркетинг ✓ Лучший ответОтвет (rawgoblin): подтверждаю, гонял на 7950X с 128гб ddr5 6000, крупная MoE дает около 6 t/s. на эпике с 8 каналами у знакомого та же модель 18-20. вся разница в каналах памяти, ядра…в «Локальные LLM и open-source модели» · 6 ответов · 56 просмотров
-
- vLLM против llama.cpp для своего api с нагрузкой, что выбрать в 2026 ✓ Лучший ответОтвет (tommee): @lfmatt, +1 за sglang, у нас на RAG где системный промпт здоровый и общий он vLLM обошёл заметнов «Локальные LLM и open-source модели» · 8 ответов · 93 просмотров
-
- Растянул 70B на два компа через rpc-server llama.cpp, гигабитной сети хватило. Но есть нюансы ✓ Лучший ответОтвет (madem): заведется, но пинг по вайфаю скачет, а тут на каждый токен раундтрип между машинами. будет дергаться. кабель за 300 рублей с озона решает, не ленисьв «Локальные LLM и open-source модели» · 6 ответов · 56 просмотров
-
- Собрал риг на двух Tesla P40 с авито, рассказываю почему не надо ✓ Лучший ответОтвет (Bowden): ну а чего ты ждал, паскалю десятый год. это как купить ведро жигулей и удивляться что не едет как теслав «Локальные LLM и open-source модели» · 6 ответов · 49 просмотров
-
- Почему в 2026 каждый туториал по локалкам начинается с ollama ✓ Лучший ответОтвет (k8s2000): @nedati, история с r1 это жесть была, да. до сих пор попадаются кадры, которые на полном серьезе рассказывают как запускали дипсик р1 на ноуте с 16 гигамив «Локальные LLM и open-source модели» · 8 ответов · 51 просмотров
-
- Холивар, llama.cpp против vLLM для своего сервера в 2026, кто кого ✓ Лучший ответОтвет (nixos_andy): clickhousepro писал(а):llama.cpp хорош когда один-два юзера не совсем. в llama.cpp давно есть continuous batching через --parallel и --cont-batching, оно не стоит на…в «Локальные LLM и open-source модели» · 8 ответов · 46 просмотров
-
- Купил мини-ПК на Ryzen AI 9 HX 370 ради NPU под локалки, NPU оказался бесполезным. Рассказываю ✓ Лучший ответОтвет (lrichard): sepiatone писал(а):llama.cpp его не видит, ollama тем более и не увидит в обозримом будущем. в llama.cpp бэкенда под XDNA нет и в роадмапе не маячит, энтузиастов с этим…в «Локальные LLM и open-source модели» · 8 ответов · 50 просмотров
-
- Qwen3.5 вышел, мелкий MoE 42B-A6B выглядит как новый домашний дефолт ✓ Лучший ответОтвет (coder_anton): @danga, бенчи у квена последний год рисованые чуть более чем полностью. после релиза, где они в таблицах рвали клода, а на деле модель путалась в трех строках sql, веры…в «Локальные LLM и open-source модели» · 5 ответов · 48 просмотров