RepoContextBench v1
Исследование репозитория с проверкой по исходному коду.
Публичный бенчмарк для агентов, которые отвечают на практические вопросы о реальной кодовой базе. Здесь можно сравнить Score, скорость и цену, а также увидеть, что меняется, когда агент получает контекст через CodeAlive.
- Строк кода
- 512 тыс.
- Вопросов
- 20
- Утверждений
- 82
512 954 строки исходного кода в 4 181 исходных файлах по данным cloc на зафиксированном коммите agent-framework. Пустые строки и комментарии не учитываются.
Сравнение моделей
Score, скорость и цена на одном экране
На графике для каждой модели оставлен один лучший полный прогон с известной или расчётной стоимостью ответа. Score от 0 до 100 измеряет качество ответа с опорой на исходный код: покрытие взвешенных эталонных утверждений, достоверность и использование доказательств.
Score и Цена задачи
| Модель | Конфигурация | Среда запуска | Score | Среднее время задачи | Цена прогона | Цена задачи | Среднее токенов / задача |
|---|---|---|---|---|---|---|---|
| Claude Fable 5 | Инструменты репозитория · max | Claude Code | 80,7 | 85,3 с | 14,08 $ | 0,70 $ | 179,5 тыс. |
| Qwen 3.6 35B A3B | CodeAlive · deep · high | Агент CodeAlive | 77,6 | 60,7 с | 0,21 $ | 0,0105 $ | 97,68 тыс. |
| Qwen 3.6 35B A3B | CodeAlive · deep · max · без semantic search | Агент CodeAlive | 65,5 | 176,9 с | 0,28 $ | 0,0142 $ | 114,8 тыс. |
| Claude Opus 4.8 | Инструменты репозитория · max · без субагентов | Claude Code | 77,5 | 73,6 с | 7,71 $ | 0,39 $ | 199,77 тыс. |
| Claude Sonnet 4.6 | Навык CodeAlive · max | Claude Code | 72,0 | 67,7 с | 3,90 $ | 0,19 $ | 221,91 тыс. |
| GPT-5.4 mini | Инструменты репозитория · xhigh | Codex CLI | 70,0 | 168,9 с | 3,12 $ | 0,16 $ | 916,56 тыс. |
| Gemini 3.5 Flash | CodeAlive · standard · medium | Агент CodeAlive | 66,1 | 38,7 с | 2,93 $ | 0,15 $ | 119,43 тыс. |
| Gemini 3.1 Flash Lite | CodeAlive · deep · medium | Агент CodeAlive | 53,2 | 8,9 с | 0,26 $ | 0,0130 $ | 59,52 тыс. |
Все строки — полные прогоны 20 из 20 без сбоев выполнения. На графике для каждой модели оставлен лучший Score; полный прогон Qwen без semantic search приведён в таблице как отдельная конфигурация. Время, токены и стоимость судьи не учитываются. Цены — исторические данные или расчётные оценки, а не коммерческое предложение.
Эффект CodeAlive
CodeAlive повысил Score Sonnet на 6,5 пункта.
В парном сравнении использованы та же модель Sonnet 4.6, те же 20 вопросов, максимальный уровень рассуждений и фиксированные правила оценки. Менялся только способ получения контекста.
С CodeAlive Score вырос с 65,45 до 71,95.
Claude Sonnet 4.6 max
20 из 20 задач · единые правила оценки
+6,5 пункта
Инструменты репозитория
65,5
С CodeAlive
72,0
Score принимает значения от 0 до 100 и сочетает покрытие взвешенных эталонных утверждений, достоверность и использование доказательств. Чем выше, тем лучше.
Как читать цифры
Узкий и проверяемый тест исследования репозитория
20 практических вопросов
Публичный датасет охватывает архитектуру, рабочие процессы, хранение данных, потоковую обработку, наблюдаемость, устойчивость к сбоям и корректный отказ от ответа в одной зафиксированной версии репозитория.
Score с опорой на исходный код
Ответы проверяются по 82 взвешенным атомарным утверждениям и 99 точным фрагментам исходников. Score сочетает покрытие утверждений, достоверность и использование доказательств вместо простого сравнения текста.
Только статическое исследование
Агенты не могут использовать интернет, запускать тесты, выполнять или менять код и проверять поведение системы во время работы. Бенчмарк измеряет качество исследования репозитория в его текущем виде.
Следующий датасет
RepoContextBench выходит за пределы репозитория в полмиллиона строк.
Мы работаем над следующим обновлением RepoContextBench. В него войдёт датасет на кодовой базе размером более одного миллиона строк, чтобы проверять качество поиска в существенно большем объёме кода.