Перейти к основному содержимому

RepoContextBench v1

Исследование репозитория с проверкой по исходному коду.

Публичный бенчмарк для агентов, которые отвечают на практические вопросы о реальной кодовой базе. Здесь можно сравнить Score, скорость и цену, а также увидеть, что меняется, когда агент получает контекст через CodeAlive.

Строк кода
512 тыс.
Вопросов
20
Утверждений
82

512 954 строки исходного кода в 4 181 исходных файлах по данным cloc на зафиксированном коммите agent-framework. Пустые строки и комментарии не учитываются.

Сравнение моделей

Score, скорость и цена на одном экране

На графике для каждой модели оставлен один лучший полный прогон с известной или расчётной стоимостью ответа. Score от 0 до 100 измеряет качество ответа с опорой на исходный код: покрытие взвешенных эталонных утверждений, достоверность и использование доказательств.

Score и Цена задачи

Контекст CodeAliveИнструменты репозиторияСреды запуска:Агент CodeAliveClaude CodeCodex CLI
МодельКонфигурацияСреда запускаScoreСреднее время задачиЦена прогонаЦена задачиСреднее токенов / задача
Claude Fable 5Инструменты репозитория · maxClaude Code80,785,3 с14,08 $0,70 $179,5 тыс.
Qwen 3.6 35B A3BCodeAlive · deep · highАгент CodeAlive77,660,7 с0,21 $0,0105 $97,68 тыс.
Qwen 3.6 35B A3BCodeAlive · deep · max · без semantic searchАгент CodeAlive65,5176,9 с0,28 $0,0142 $114,8 тыс.
Claude Opus 4.8Инструменты репозитория · max · без субагентовClaude Code77,573,6 с7,71 $0,39 $199,77 тыс.
Claude Sonnet 4.6Навык CodeAlive · maxClaude Code72,067,7 с3,90 $0,19 $221,91 тыс.
GPT-5.4 miniИнструменты репозитория · xhighCodex CLI70,0168,9 с3,12 $0,16 $916,56 тыс.
Gemini 3.5 FlashCodeAlive · standard · mediumАгент CodeAlive66,138,7 с2,93 $0,15 $119,43 тыс.
Gemini 3.1 Flash LiteCodeAlive · deep · mediumАгент CodeAlive53,28,9 с0,26 $0,0130 $59,52 тыс.

Все строки — полные прогоны 20 из 20 без сбоев выполнения. На графике для каждой модели оставлен лучший Score; полный прогон Qwen без semantic search приведён в таблице как отдельная конфигурация. Время, токены и стоимость судьи не учитываются. Цены — исторические данные или расчётные оценки, а не коммерческое предложение.

Эффект CodeAlive

CodeAlive повысил Score Sonnet на 6,5 пункта.

В парном сравнении использованы та же модель Sonnet 4.6, те же 20 вопросов, максимальный уровень рассуждений и фиксированные правила оценки. Менялся только способ получения контекста.

С CodeAlive Score вырос с 65,45 до 71,95.

Claude Sonnet 4.6 max

20 из 20 задач · единые правила оценки

+6,5 пункта

Инструменты репозитория

65,5

С CodeAlive

72,0

Score принимает значения от 0 до 100 и сочетает покрытие взвешенных эталонных утверждений, достоверность и использование доказательств. Чем выше, тем лучше.

Как читать цифры

Узкий и проверяемый тест исследования репозитория

20 практических вопросов

Публичный датасет охватывает архитектуру, рабочие процессы, хранение данных, потоковую обработку, наблюдаемость, устойчивость к сбоям и корректный отказ от ответа в одной зафиксированной версии репозитория.

Score с опорой на исходный код

Ответы проверяются по 82 взвешенным атомарным утверждениям и 99 точным фрагментам исходников. Score сочетает покрытие утверждений, достоверность и использование доказательств вместо простого сравнения текста.

Только статическое исследование

Агенты не могут использовать интернет, запускать тесты, выполнять или менять код и проверять поведение системы во время работы. Бенчмарк измеряет качество исследования репозитория в его текущем виде.

Следующий датасет

RepoContextBench выходит за пределы репозитория в полмиллиона строк.

Мы работаем над следующим обновлением RepoContextBench. В него войдёт датасет на кодовой базе размером более одного миллиона строк, чтобы проверять качество поиска в существенно большем объёме кода.

Читать отчёт v1