Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?
Рейтинг: 43.4% · 11 голосов
Войдите, чтобы голосовать
Голосовать «За» и «Против» могут только авторизованные пользователи. Войдите в свой аккаунт — или зарегистрируйтесь, это займёт минуту.
Нет аккаунта? Зарегистрироваться
- Tcraw62981
- Сообщения: 41
- Зарегистрирован: 11 май 2026, 21:02
✔ Лучший ответ сформирован автоматически — vuepro
На своём опыте с кодбазой ~80к строк TypeScript: контекст в 1М токенов — это не то что он читает весь одновременно полезно, а то что не приходится обрезать вручную при больших задачах. Реальный выигрыш заметен когда задача затрагивает 15-20 файлов с взаимными зависимостями — Cursor c 200k окном начинал терять края, CC держит связность дольше. Но SWE-bench это синтетика, там задачи изолированные…
- darkblueteam
- Сообщения: 6
- Зарегистрирован: 11 май 2026, 02:36
Re: Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?
На монорепе ощущается. Он реально держит связи между файлами которые Cursor терял. Но 1М контекста маркетинг немного лукавит — после compaction эффективный объём заметно меньше, в другом треде это обсуждали.
Re: Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?
✔ Лучший ответ — сформирован автоматически
На своём опыте с кодбазой ~80к строк TypeScript: контекст в 1М токенов — это не то что он читает весь одновременно полезно, а то что не приходится обрезать вручную при больших задачах. Реальный выигрыш заметен когда задача затрагивает 15-20 файлов с взаимными зависимостями — Cursor c 200k окном начинал терять края, CC держит связность дольше. Но SWE-bench это синтетика, там задачи изолированные. На живом проекте с запутанными абстракциями и неочевидными зависимостями качество всё равно деградирует после ~100k токенов активного контекста, просто чуть позже.
Re: Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?
Самый честный тест который я делал: взял задачу на рефакторинг модуля авторизации с затрагиванием 8 файлов, middleware, тестами и миграцией. CC прошёл её без промежуточных уточнений, сам нашёл все места где надо менять интерфейс. Cursor с тем же промптом попросил уточнения трижды и всё равно пропустил один из middleware. Разница реальная, но не в 10 раз — скорее в 1.5-2 раза по итоговому качеству на комплексных мультифайловых задачах. Для мелких однофайловых изменений оба одинаково хороши.
- k8s_master
- Сообщения: 44
- Зарегистрирован: 11 май 2026, 19:55
Re: Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?
@darkblueteam, какая перезагрузка? Ты тредом не ошибся, тут про бенчмарки Claude Code вообще-то.
- smith_zhenya
- Сообщения: 32
- Зарегистрирован: 11 май 2026, 02:02
Re: Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?
Гонял на легаси монолите, ~300к строк PHP 7.4 пополам с jQuery. Так вот, бенчи бенчами, а на таком коде никакой 1М не спасает, он начинает уверенно чинить то, что не сломано. Где CC реально хорош, это когда в кодбазе есть структура и тесты. Где помойка, там он генерит правдоподобную помойку дальше. И да, на Pro подписке за вечер плотной работы упираешься в лимиты, имейте в виду.
Re: Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?
@k8s_master, откуда 72% acceptance у Supermaven? Это их же цифра из маркетингового блога. По моим ощущениям принимаю хорошо если треть подсказок, остальное шум, который еще и сбивает, когда думаешь. Держать оба инструмента ок, но не надо чужой пресс-релиз цитировать как факт.
Поделиться темой:
✈ Telegram
VK
- Похожие темы
-
-
-
-
-
- Бросить найм ради своего проекта: при каком MRR вы реально решились уйти с работы?
10 ответов · 2128 просмотров
-
- С чего реально начать в пентесте в 2026? TryHackMe, HTB или сразу сертификаты?
12 ответов · 2009 просмотров
Похожие запросы:
как уменьшить расход токенов claude
Кто сейчас на конференции
Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость