RepoContextBench
На той же модели harness CodeAlive набрал на 18,7 пункта больше, чем OpenCode.
Оба агента работали на DeepSeek V4.1 Flash с reasoning effort max и отвечали на одни и те же 40 вопросов по двум open-source репозиториям. CodeAlive набрал 65,3, OpenCode — 46,6, а на репозитории в 1,5 млн строк CodeAlive потратил в 3,6 раза меньше токенов. Опубликованное сравнение семи моделей на v1 — ниже на странице.
RepoContextBench v2 · внутренние диагностические прогоны
Одна модель, три агента
DeepSeek V4.1 Flash с reasoning effort max, по 20 вопросов на каждый репозиторий. Score от 0 до 100 измеряет качество ответа по эталонным утверждениям из кода. Чем выше, тем лучше.
Score, все 40 вопросов
+18,7 пункта к OpenCode
+40 %
OpenCode
46,6
OpenCode + CodeAlive MCP
50,3
Harness CodeAlive
65,3
Инструменты CodeAlive, подключённые к OpenCode по MCP, закрыли примерно пятую часть разрыва. Остальное даёт сам harness: как агент ищет, читает код по символам и решает, что доказательств достаточно.
| Агент | Agent Framework(откроется в новой вкладке)~513 тыс. строк · Lite | Sapling(откроется в новой вкладке)~1,5 млн строк · Hard | Все 40 |
|---|---|---|---|
| OpenCode | 49,3 | 43,9 | 46,6 |
| OpenCode + CodeAlive MCP | 53,9 | 46,7 | 50,3 |
| Harness CodeAlive | 74,0 | 56,7 | 65,3 |
На Sapling: в 3,6 раза меньше токенов и втрое быстрее
Токены и время на задачу, в среднем по 20 задачам. Уже CodeAlive по MCP сократил расход токенов OpenCode на Sapling на 30%, полный harness — на 73%.
| На задачу | OpenCode | Harness CodeAlive | CodeAlive к OpenCode | |
|---|---|---|---|---|
| Sapling(откроется в новой вкладке)~1,5 млн строк · Hard | ||||
| Токены | 2,8 млн | 767 тыс. | −73 % | |
| Время | 297 с | 104 с | −65 % | |
| Agent Framework(откроется в новой вкладке)~513 тыс. строк · Lite | ||||
| Токены | 180 тыс. | 398 тыс. | +121 % | |
| Время | 42 с | 50 с | +19 % | |
Экономия растёт с размером кодовой базы непропорционально. На Agent Framework (~513 тыс. строк) CodeAlive выиграл только в качестве ответов: токенов он потратил больше, чем OpenCode, и получил за них 24,7 пункта. На Sapling (~1,5 млн строк) универсальный агент начинает блуждать по коду, и там CodeAlive выигрывает и в качестве, и в токенах, и во времени.
Читать полный отчётПо одному прогону на конфигурацию; повтор того же прогона сдвигал оценку примерно на ±2 пункта, а расход токенов — примерно на 14%. Токены — вход и выход по данным провайдера, включая кешированный вход; построение индекса CodeAlive не учтено. Судья — Muse Spark 1.3 с reasoning effort medium, два голоса на задачу. Датасет v2 пока не опубликован, а судья отличается от v1, поэтому оценки v1 и v2 сравнивать нельзя.
RepoContextBench v1 · опубликованные результаты
Qwen 3.6 в harness CodeAlive на уровне Claude Opus 4.8
20 вопросов по Agent Framework, семь моделей, все прогоны.
RepoContextBench v1 · опубликованные результаты
Qwen 3.6 в harness CodeAlive на уровне Claude Opus 4.8
20 вопросов по Agent Framework, семь моделей, все прогоны.
Qwen 3.6 35B A3B, небольшая открытая модель с включённым reasoning, в исследовательском harness CodeAlive набрала 77,6. Claude Opus 4.8 с reasoning effort max в Claude Code — 77,45. Прогон Qwen по всем 20 вопросам стоил около $0,21, прогон Opus — $7,71. Судья — GPT-5.5 с reasoning effort high.
- Строк кода
- 513 тыс.
- Вопросов
- 20
- Утверждений
- 82
Что даёт semantic search CodeAlive
Qwen 3.6 35B A3B · reasoning on · 20 из 20 задач
+12,15 пункта
Harness CodeAlive без semantic search
65,45
Harness CodeAlive с semantic search
77,6
Для сравнения: Claude Opus 4.8 · max · Claude Code
77,45
Заодно среднее время задачи у Qwen сократилось с 176,9 с до 60,7 с.
Score принимает значения от 0 до 100 и сочетает покрытие взвешенных эталонных утверждений, достоверность и использование доказательств. Чем выше, тем лучше.
Семь моделей
Score против цены, времени и токенов
Каждая точка — лучший полный прогон одной модели; reasoning effort входит в конфигурацию. Score от 0 до 100 измеряет качество ответа с опорой на исходный код: покрытие взвешенных эталонных утверждений, достоверность и использование доказательств.
Score и Цена задачи
Показать все прогоны
| Модель | Конфигурация | Среда запуска | Score | Среднее время задачи | Цена прогона | Цена задачи | Среднее токенов / задача |
|---|---|---|---|---|---|---|---|
| Claude Fable 5 | Инструменты репозитория · max | Claude Code | 80,7 | 85,3 с | 14,08 $ | 0,70 $ | 179,5 тыс. |
| Qwen 3.6 35B A3B | CodeAlive · deep · reasoning on | Агент CodeAlive | 77,6 | 60,7 с | 0,21 $ | 0,0105 $ | 97,68 тыс. |
| Qwen 3.6 35B A3B | CodeAlive · deep · reasoning on · без semantic search | Агент CodeAlive | 65,45 | 176,9 с | 0,28 $ | 0,0142 $ | 114,8 тыс. |
| Claude Opus 4.8 | Инструменты репозитория · max · без субагентов | Claude Code | 77,45 | 73,6 с | 7,71 $ | 0,39 $ | 199,77 тыс. |
| Claude Sonnet 4.6 | Скилл CodeAlive · max | Claude Code | 71,95 | 67,7 с | 3,90 $ | 0,19 $ | 221,91 тыс. |
| GPT-5.4 mini | Инструменты репозитория · xhigh | Codex CLI | 69,95 | 168,9 с | 3,12 $ | 0,16 $ | 916,56 тыс. |
| Gemini 3.5 Flash | CodeAlive · standard · medium | Агент CodeAlive | 66,1 | 38,7 с | 2,93 $ | 0,15 $ | 119,43 тыс. |
| Gemini 3.1 Flash Lite | CodeAlive · deep · medium | Агент CodeAlive | 53,2 | 8,9 с | 0,26 $ | 0,0130 $ | 59,52 тыс. |
Все строки — полные прогоны 20 из 20 без сбоев выполнения. На графике для каждой модели оставлен лучший Score; полный прогон Qwen без semantic search приведён в таблице как отдельная конфигурация. Время, токены и стоимость судьи не учитываются. Цены — исторические данные или расчётные оценки, а не коммерческое предложение.
512 954 строки исходного кода в 4 181 исходных файлах по данным cloc на зафиксированном коммите agent-framework. Пустые строки и комментарии не учитываются.
Как читать цифры
Узкий и проверяемый тест исследования репозитория
Два репозитория
В v1 и в треке Lite v2 одни и те же 20 вопросов по Microsoft Agent Framework(откроется в новой вкладке) (~513 тыс. строк). v2 добавляет 20 более сложных вопросов по Sapling(откроется в новой вкладке), системе контроля версий от Meta (~1,5 млн строк на Rust, Python, C++ и TypeScript). Строки считаются через cloc, без пустых строк и комментариев.
Score с опорой на исходный код
LLM-судья сверяет каждый ответ со взвешенными атомарными утверждениями и точными фрагментами исходников, а не с формулировкой. В v1 судит GPT-5.5 с reasoning effort high, в диагностических прогонах v2 — Muse Spark 1.3 с medium.
Только статическое исследование
Агенты не могут использовать интернет, запускать тесты, выполнять или менять код и проверять поведение системы во время работы. Бенчмарк измеряет качество исследования репозитория в его текущем виде.
Отчёты