Почему агент не должен сам выбирать архитектуру незнакомой задачи
Симптом
Агент почти двое суток пытался решить задачу клонирования голоса известного персонажа, но не приближался к проверяемому результату.
Контекст
Я баловался с Hermes в рамках эксперимента по клонированию голоса. Агент перебрал несколько фреймворков и архитектур и в конце начал обучать ещё один вариант. При этом у меня не было ясного ответа, какой результат должен получиться на каждом этапе и как отличить рабочее решение от очередной неудачной попытки.
Корневая причина
Задачу с незнакомой предметной областью отдали агенту вместе с архитектурным выбором и оценкой результата. У агента не было достаточной экспертизы и набора критериев, чтобы самостоятельно выбрать подход, распознать ошибочное направление и остановиться.
Ошибочное предположение
Я предполагал, что агент сам выберет подходящий метод, проверит качество и доведёт задачу до результата. На практике агент может эффективно реализовать понятный план, но это не означает, что он способен надёжно исследовать незнакомую область и валидировать её результат без внешних ориентиров.
Обнаружение
Повторная попытка с тем же неопределённым планом не давала новой информации. Если агент не может объяснить, какой эксперимент проверяет гипотезу и какой результат считается успехом, дополнительные итерации становятся перебором, а не исследованием.
Это полезный ранний сигнал для остановки и пересмотра задачи, а не повод просто увеличивать число попыток.
Исправление
В качестве следующего шага я сформулировал высокоуровневое исследование и зафиксировал:
- выбранную архитектуру и причины выбора;
- последовательность этапов;
- входы и ожидаемые артефакты каждого этапа;
- критерии качества и способ проверки результата;
- условия остановки или смены подхода.
После этого агенту были переданы отдельные этапы с ограниченным числом архитектурных решений, сохраняя за человеком контроль над направлением и оценкой.
Проверка
Регрессионный сценарий для такого процесса должен требовать от агента перед реализацией описать план, критерий успеха и следующий проверяемый эксперимент. После каждого этапа результат должен сравниваться с этим критерием, а не только с тем, завершились ли команды без ошибки.
В исходной заметке автоматическая проверка этого процесса не зафиксирована.
Общий вывод
Агенту можно делегировать реализацию, но нельзя молча делегировать исследование незнакомой области, архитектурный выбор и оценку качества. Сначала человек задаёт карту решения и наблюдаемые критерии, затем агент ускоряет движение по ней.