Перейти к основному содержимому

RepoContextBench

На той же модели harness CodeAlive набрал на 18,7 пункта больше, чем OpenCode.

Оба агента работали на DeepSeek V4.1 Flash с reasoning effort max и отвечали на одни и те же 40 вопросов по двум open-source репозиториям. CodeAlive набрал 65,3, OpenCode — 46,6, а на репозитории в 1,5 млн строк CodeAlive потратил в 3,6 раза меньше токенов. Опубликованное сравнение семи моделей на v1 — ниже на странице.

RepoContextBench v2 · внутренние диагностические прогоны

Одна модель, три агента

DeepSeek V4.1 Flash с reasoning effort max, по 20 вопросов на каждый репозиторий. Score от 0 до 100 измеряет качество ответа по эталонным утверждениям из кода. Чем выше, тем лучше.

Score, все 40 вопросов

+18,7 пункта к OpenCode

+40 %

OpenCode

46,6

OpenCode + CodeAlive MCP

50,3

Harness CodeAlive

65,3

Инструменты CodeAlive, подключённые к OpenCode по MCP, закрыли примерно пятую часть разрыва. Остальное даёт сам harness: как агент ищет, читает код по символам и решает, что доказательств достаточно.

АгентAgent Framework(откроется в новой вкладке)Sapling(откроется в новой вкладке)Все 40
OpenCode49,343,946,6
OpenCode + CodeAlive MCP53,946,750,3
Harness CodeAlive74,056,765,3

На Sapling: в 3,6 раза меньше токенов и втрое быстрее

Токены и время на задачу, в среднем по 20 задачам. Уже CodeAlive по MCP сократил расход токенов OpenCode на Sapling на 30%, полный harness — на 73%.

На задачуOpenCodeHarness CodeAliveCodeAlive к OpenCode
Sapling(откроется в новой вкладке)~1,5 млн строк · Hard
Токены2,8 млн767 тыс.−73 %
Время297 с104 с−65 %
Agent Framework(откроется в новой вкладке)~513 тыс. строк · Lite
Токены180 тыс.398 тыс.+121 %
Время42 с50 с+19 %

Экономия растёт с размером кодовой базы непропорционально. На Agent Framework (~513 тыс. строк) CodeAlive выиграл только в качестве ответов: токенов он потратил больше, чем OpenCode, и получил за них 24,7 пункта. На Sapling (~1,5 млн строк) универсальный агент начинает блуждать по коду, и там CodeAlive выигрывает и в качестве, и в токенах, и во времени.

Читать полный отчёт

По одному прогону на конфигурацию; повтор того же прогона сдвигал оценку примерно на ±2 пункта, а расход токенов — примерно на 14%. Токены — вход и выход по данным провайдера, включая кешированный вход; построение индекса CodeAlive не учтено. Судья — Muse Spark 1.3 с reasoning effort medium, два голоса на задачу. Датасет v2 пока не опубликован, а судья отличается от v1, поэтому оценки v1 и v2 сравнивать нельзя.

RepoContextBench v1 · опубликованные результаты

Qwen 3.6 в harness CodeAlive на уровне Claude Opus 4.8

20 вопросов по Agent Framework, семь моделей, все прогоны.

Qwen 3.6 35B A3B, небольшая открытая модель с включённым reasoning, в исследовательском harness CodeAlive набрала 77,6. Claude Opus 4.8 с reasoning effort max в Claude Code — 77,45. Прогон Qwen по всем 20 вопросам стоил около $0,21, прогон Opus — $7,71. Судья — GPT-5.5 с reasoning effort high.

Строк кода
513 тыс.
Вопросов
20
Утверждений
82

Что даёт semantic search CodeAlive

Qwen 3.6 35B A3B · reasoning on · 20 из 20 задач

+12,15 пункта

Harness CodeAlive без semantic search

65,45

Harness CodeAlive с semantic search

77,6

Для сравнения: Claude Opus 4.8 · max · Claude Code

77,45

Заодно среднее время задачи у Qwen сократилось с 176,9 с до 60,7 с.

Score принимает значения от 0 до 100 и сочетает покрытие взвешенных эталонных утверждений, достоверность и использование доказательств. Чем выше, тем лучше.

Семь моделей

Score против цены, времени и токенов

Каждая точка — лучший полный прогон одной модели; reasoning effort входит в конфигурацию. Score от 0 до 100 измеряет качество ответа с опорой на исходный код: покрытие взвешенных эталонных утверждений, достоверность и использование доказательств.

Score и Цена задачи

Контекст CodeAliveИнструменты репозиторияСреды запуска:Агент CodeAliveClaude CodeCodex CLI
Показать все прогоны
МодельКонфигурацияСреда запускаScoreСреднее время задачиЦена прогонаЦена задачиСреднее токенов / задача
Claude Fable 5Инструменты репозитория · maxClaude Code80,785,3 с14,08 $0,70 $179,5 тыс.
Qwen 3.6 35B A3BCodeAlive · deep · reasoning onАгент CodeAlive77,660,7 с0,21 $0,0105 $97,68 тыс.
Qwen 3.6 35B A3BCodeAlive · deep · reasoning on · без semantic searchАгент CodeAlive65,45176,9 с0,28 $0,0142 $114,8 тыс.
Claude Opus 4.8Инструменты репозитория · max · без субагентовClaude Code77,4573,6 с7,71 $0,39 $199,77 тыс.
Claude Sonnet 4.6Скилл CodeAlive · maxClaude Code71,9567,7 с3,90 $0,19 $221,91 тыс.
GPT-5.4 miniИнструменты репозитория · xhighCodex CLI69,95168,9 с3,12 $0,16 $916,56 тыс.
Gemini 3.5 FlashCodeAlive · standard · mediumАгент CodeAlive66,138,7 с2,93 $0,15 $119,43 тыс.
Gemini 3.1 Flash LiteCodeAlive · deep · mediumАгент CodeAlive53,28,9 с0,26 $0,0130 $59,52 тыс.

Все строки — полные прогоны 20 из 20 без сбоев выполнения. На графике для каждой модели оставлен лучший Score; полный прогон Qwen без semantic search приведён в таблице как отдельная конфигурация. Время, токены и стоимость судьи не учитываются. Цены — исторические данные или расчётные оценки, а не коммерческое предложение.

512 954 строки исходного кода в 4 181 исходных файлах по данным cloc на зафиксированном коммите agent-framework. Пустые строки и комментарии не учитываются.

Как читать цифры

Узкий и проверяемый тест исследования репозитория

Два репозитория

В v1 и в треке Lite v2 одни и те же 20 вопросов по Microsoft Agent Framework(откроется в новой вкладке) (~513 тыс. строк). v2 добавляет 20 более сложных вопросов по Sapling(откроется в новой вкладке), системе контроля версий от Meta (~1,5 млн строк на Rust, Python, C++ и TypeScript). Строки считаются через cloc, без пустых строк и комментариев.

Score с опорой на исходный код

LLM-судья сверяет каждый ответ со взвешенными атомарными утверждениями и точными фрагментами исходников, а не с формулировкой. В v1 судит GPT-5.5 с reasoning effort high, в диагностических прогонах v2 — Muse Spark 1.3 с medium.

Только статическое исследование

Агенты не могут использовать интернет, запускать тесты, выполнять или менять код и проверять поведение системы во время работы. Бенчмарк измеряет качество исследования репозитория в его текущем виде.