Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?

Теги: #Claude Code
Рейтинг: 43.4% · 11 голосов
Программирование с искусственным интеллектом: Claude Code, Cursor, GitHub Copilot, agentic coding, протокол MCP, генерация и ревью кода, автоматизация рабочего процесса разработчика.
Аватара пользователя
Tcraw62981
Сообщения: 41
Зарегистрирован: 11 май 2026, 21:02

Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?

Сообщение Tcraw62981 »

Везде пишут CC лидирует: 80.8% на SWE-bench Verified, контекст до 1М токенов, лучший для мультифайловых задач. Кто на больших кодбазах реально гонял — это в работе ощущается или цифры ради цифр?
👍1 ❤️ 🔥 😄 🤔
✔ Лучший ответ сформирован автоматически — vuepro
На своём опыте с кодбазой ~80к строк TypeScript: контекст в 1М токенов — это не то что он читает весь одновременно полезно, а то что не приходится обрезать вручную при больших задачах. Реальный выигрыш заметен когда задача затрагивает 15-20 файлов с взаимными зависимостями — Cursor c 200k окном начинал терять края, CC держит связность дольше. Но SWE-bench это синтетика, там задачи изолированные…
Перейти к ответу →
Аватара пользователя
darkblueteam
Сообщения: 6
Зарегистрирован: 11 май 2026, 02:36

Re: Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?

Сообщение darkblueteam »

Подскажите, а как быть если ошибка повторяется после перезагрузки?
👍1 ❤️ 🔥 😄 🤔
Аватара пользователя
alansmit
Сообщения: 84
Зарегистрирован: 13 май 2026, 00:35

Re: Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?

Сообщение alansmit »

На монорепе ощущается. Он реально держит связи между файлами которые Cursor терял. Но 1М контекста маркетинг немного лукавит — после compaction эффективный объём заметно меньше, в другом треде это обсуждали.
👍 ❤️ 🔥1 😄 🤔
Аватара пользователя
vuepro
Сообщения: 6
Зарегистрирован: 23 май 2026, 06:35

Re: Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?

Сообщение vuepro »

✔ Лучший ответ — сформирован автоматически
На своём опыте с кодбазой ~80к строк TypeScript: контекст в 1М токенов — это не то что он читает весь одновременно полезно, а то что не приходится обрезать вручную при больших задачах. Реальный выигрыш заметен когда задача затрагивает 15-20 файлов с взаимными зависимостями — Cursor c 200k окном начинал терять края, CC держит связность дольше. Но SWE-bench это синтетика, там задачи изолированные. На живом проекте с запутанными абстракциями и неочевидными зависимостями качество всё равно деградирует после ~100k токенов активного контекста, просто чуть позже.
👍 ❤️2 🔥 😄2 🤔1
Аватара пользователя
Vvz1995
Сообщения: 34
Зарегистрирован: 14 май 2026, 01:29

Re: Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?

Сообщение Vvz1995 »

Самый честный тест который я делал: взял задачу на рефакторинг модуля авторизации с затрагиванием 8 файлов, middleware, тестами и миграцией. CC прошёл её без промежуточных уточнений, сам нашёл все места где надо менять интерфейс. Cursor с тем же промптом попросил уточнения трижды и всё равно пропустил один из middleware. Разница реальная, но не в 10 раз — скорее в 1.5-2 раза по итоговому качеству на комплексных мультифайловых задачах. Для мелких однофайловых изменений оба одинаково хороши.
👍 ❤️2 🔥1 😄 🤔
Аватара пользователя
k8s_master
Сообщения: 44
Зарегистрирован: 11 май 2026, 19:55

Re: Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?

Сообщение k8s_master »

Cursor выигрывает по DX: автокомплит Supermaven с 72% acceptance, Composer для визуального мультифайл-эдитинга. CC выигрывает по тяжёлым задачам. Я держу оба и не парюсь, у каждого своя ниша.
👍2 ❤️ 🔥 😄 🤔
Аватара пользователя
ama123
Сообщения: 19
Зарегистрирован: 11 май 2026, 09:03

Re: Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?

Сообщение ama123 »

А есть смысл это делать в проде или только для локалки подходит?
👍1 ❤️ 🔥1 😄 🤔3
Аватара пользователя
sylvia666
Сообщения: 29
Зарегистрирован: 12 май 2026, 13:58

Re: Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?

Сообщение sylvia666 »

@darkblueteam, какая перезагрузка? Ты тредом не ошибся, тут про бенчмарки Claude Code вообще-то.
👍2 ❤️ 🔥 😄1 🤔2
Аватара пользователя
smith_zhenya
Сообщения: 32
Зарегистрирован: 11 май 2026, 02:02

Re: Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?

Сообщение smith_zhenya »

Гонял на легаси монолите, ~300к строк PHP 7.4 пополам с jQuery. Так вот, бенчи бенчами, а на таком коде никакой 1М не спасает, он начинает уверенно чинить то, что не сломано. Где CC реально хорош, это когда в кодбазе есть структура и тесты. Где помойка, там он генерит правдоподобную помойку дальше. И да, на Pro подписке за вечер плотной работы упираешься в лимиты, имейте в виду.
👍 ❤️1 🔥 😄 🤔1
Аватара пользователя
van100
Сообщения: 19
Зарегистрирован: 16 май 2026, 02:09

Re: Claude Code SWE-bench 80.8% и контекст 1M — это реально чувствуется или маркетинг?

Сообщение van100 »

@k8s_master, откуда 72% acceptance у Supermaven? Это их же цифра из маркетингового блога. По моим ощущениям принимаю хорошо если треть подсказок, остальное шум, который еще и сбивает, когда думаешь. Держать оба инструмента ок, но не надо чужой пресс-релиз цитировать как факт.
👍2 ❤️1 🔥1 😄 🤔
Ответить
Поделиться темой: ✈ Telegram VK
Похожие запросы: как уменьшить расход токенов claude

Вернуться в «AI-ассистированная разработка»

Кто сейчас на конференции

Сейчас этот форум просматривают: нет зарегистрированных пользователей и 1 гость