malahov.io

Ревью-агент на Fable 5 нашёл всё, что я не проверил

На неделю открыли новую сильную модель Anthropic — Fable 5, — и первым делом я не стал писать ею код, а направил её на ревью своих правок. Она нашла поразительное количество багов и сама составила план фиксов.

Автор: Georg Malahov

Вчерашний день кончился раздражением. Простая с виду задача — навигация свайпом назад в моём приложении диктовки, веб-приложении, где наговариваешь текст и получаешь его чистым, — превратилась в рекордную по длительности сессию: агент работал почти семь часов, запустил 227 фоновых под-агентов и что-то сделал, но криво. Обновление страницы на экране результата так и не работает. Целый день мелких, практически невидимых фич — и ощущение, что день прошёл впустую.

А сегодня я обновил приложение Claude, и в подписке на неделю стала доступна новая, самая сильная модель Anthropic — Fable 5. Лимитов очень мало, поэтому тратить её на написание кода я не стал. Первым делом я направил её на ревью.

Сначала — на вчерашнюю задачу в диктовке. Потом — на все правки, которые я за последние недели набросал в Call Copilot, моё браузерное расширение для транскрибации звонков, и так и не проверил руками. Результат меня поразил: огромное количество багов. По мнению модели, там вообще почти ничего не работает.

Устроено это просто. Ревью-агент получает изменения в коде и проходит по ним как чужой ревьюер, который этот код не писал: ищет баги, уязвимости, недочёты. Но главное — на выходе не список претензий, а детальный, чёткий план фиксов. Этот план я запускаю исполняться агентам, потом снова делаю ревью — и так по кругу. Задача в диктовке после первой такой итерации стала значительно лучше: практически всё, как я хотел, ручной визуальный тест проходит. Тем не менее после первой итерации ревью нашло ещё багов — сейчас запускаю вторую.

Фаза ревью в моём цикле была и раньше, но именно с этой моделью она заработала так, что пользу чувствуешь сразу — по тому, какие баги она находит и как эффективно. Похоже, я приду к связке: код пишет обычная модель, а ревью и планы делает самая сильная — возможно, даже за деньги, потому что это того стоит. Если всю грязную работу — поиск недочётов и план — сделать заранее сильной моделью, то дальше остаётся дёшево исполнять и снова проверять.

Параллельно я отдал агенту и совсем другую работу: разнести счета из Stripe по бухгалтерии. Из двухсот двух нераспределённых транзакций к вечеру осталось сто восемьдесят пять — он сам скачал документы, переименовал, начал загружать и присваивать категории. Сам я до этой задачи не мог добраться месяцами.

У меня есть неделя с этой моделью. План на неё простой: ревьюить всё, до чего дотянусь, — и по второй итерации на диктовке станет ясно, сходится ли список найденного к мелочам или это ревью можно крутить бесконечно.