Блог
Инженерные заметки об агентах для кода, контексте и системах вокруг них.
Последняя статья
CodeAlive и открытые индексаторы графа кода: проверка по компилятору
На Playwright, Zod и FluentValidation 98,5–98,9% вызовов в графе CodeAlive совпали с компилятором, и он нашёл 82–91% всех вызовов. У сильнейшего открытого инструмента, который мы смогли оценить, — 41–65% и 40–51%.
Читать статьюДругие статьи
09Harness CodeAlive против OpenCode: плюс 18,7 пункта на той же модели
Одна модель, одни и те же 40 вопросов RepoContextBench v2. Исследовательский harness CodeAlive набрал 65,3, OpenCode — 46,6. На репозитории в 1,5 млн строк CodeAlive к тому же потратил в 3,6 раза меньше токенов и втрое меньше времени на задачу.
GraphRAG по коду: когда граф вызовов действительно помогает агенту
На репозитории в 0,5 млн строк граф вызовов почти не изменил результат в RepoContextBench, на репозитории в 1,5 млн строк агент с ним находил заметно больше нужного кода. А сложнее всего оказалось заставить агента вообще пользоваться графом.
Улучшаем следование инструкциям через подсказки следующих шагов в ответе tool call
Локальная инструкция в конце ответа помогает небольшим моделям понять данные и выбрать следующее полезное действие.
Как мы автоматизировали тестирование MCP OAuth 2.1
Как проверить браузерный OAuth flow для MCP с настоящим loopback callback, PKCE и Playwright.
Как дать Kimi K3 более короткий путь к нужному коду
По предварительным результатам RepoContextBench, CodeAlive сокращает время задач Kimi Code с Kimi K3 на 31%, а расход токенов агента — на 28%.
CodeAlive 3.0: от context engine к агенту для исследования кода
Что вошло в CodeAlive 3.0: проверенный продакшеном context engine, собственный агент для исследования кода, бенчмарк RepoContextBench и новые Tool API и MCP.
Как развивался CodeAlive MCP: от трёх инструментов до исследовательского интерфейса
Как в CodeAlive MCP менялись инструменты, извлечение кода, форматы ответов и обработка ошибок на пути к v3.
RepoContextBench: как Qwen 3.6-35B обошёл Sonnet 4.6
Qwen 3.6-35B A3B набрал 77,6 в CodeAlive agent harness, опередив Opus 4.8 с 77,45 и Sonnet 4.6 с 71,95.
Каноникализация аргументов для небольших агентных LLM: практический AX-паттерн
Скалярная строка сломала вызов инструмента, ожидавшего массив. Мы исправили это один раз — на границе вызова функций в Microsoft Agent Framework.
Новые статьи
Следите за работой, а не за маркетинговой воронкой
Одно прямое письмо после публикации. Без отслеживания открытий и кликов, продаж и чаще одного раза в день.