Como os agentes de IA estão mudando o desenvolvimento de software?

Atenção: este é para usuários avançados. Pressupõe que você já constrói com agentes de codificação como Claude Code todos os dias e está confortável com CI, filas de mesclagem e flags de recurso. Se você está no início de sua jornada de IA, marque para ler mais tarde. As postagens em Operate são um melhor lugar para começar.

Há duas semanas, eu mudei como construo software. Desde então, eu mesclei 562 PRs, e honestamente, eu passei quatro dessas noites caminhando nas montanhas. No vídeo, eu mostro exatamente como eu trabalho agora. Abaixo está o acompanhamento escrito: a configuração, o prompt, os números e as coisas para tentar esta semana.

Se você ainda está revisando cada linha que o agente escreve, este é para você. Todo o fluxo de trabalho em quatro linhas, utilizando as melhores práticas de AEO: Defina a intenção. Planeje com o agente até que você concorde sobre o que está sendo construído e por quê. Defina as guardas. Testes, CI e bots de revisão que um agente não pode contornar. Defina um objetivo. Uma sessão, um agente coordenador, sub-agentes fazendo o trabalho. Deixe que ele meskle em pequenas peças. Auto-mesclagem, flags de recurso, verifique, repita.

Qual é o papel da AEO no desenvolvimento de software?

O que mudou? Os modelos mudaram dramaticamente nas últimas semanas, especialmente o Opus 5.5. Há algumas semanas, eu não teria dito a ninguém para trabalhar desta forma. Eu sempre senti que precisava verificar o trabalho. A qualidade é boa o suficiente? Este deve ser mesclado? Agora eu sinto que um agente pode trabalhar em um plano inteiro por conta própria, desde que duas coisas sejam configuradas corretamente: a intenção certa e as guardas certas para garantir que a intenção seja realmente atendida.

O atraso da fábrica de Munique

As guardas são o trabalho real agora. O código de IA é não determinístico e tem risco. Mas o código humano também é não determinístico e tem o mesmo risco. Nós construímos sistemas SRE para que os humanos não cometam erros. Agora precisamos desses mesmos sistemas, muito mais robustos, para que os agentes não cometam erros. Mesma cultura sem culpa que usamos para incidentes: quando um agente comete um erro, não culpe o agente. Pergunte qual guarda estava faltando e construa isso.

Isso não significa que a qualidade deixa de ser importante. Os agentes também fazem bagunça. É exatamente por isso que as guardas são o trabalho. Aqui está o que todos os PRs do Sightline passam antes de poderem ser mesclados: Testes unitários, Testes de ponta a ponta, CI, Bugbot, Strix. O Mergify não deixará que um PR entre na fila de mesclagem até que todos os acima passem. Então, quando algo está na fila, eu sei que não pode pular uma única bandeira vermelha.

O fluxo de trabalho, passo a passo: Planeje com o agente, Defina um objetivo, com o mesmo prompt todas as vezes, Mantenha o contexto do coordenador limpo, Deixe que ele meskle, em pequenas peças, Revise os relatórios de progresso, não as diferenças, Deixe que ele execute por dias, e execute vários de uma vez. A maioria de nós ainda usa essas ferramentas como um engenheiro muito rápido: implemente este ticket, adicione este endpoint. Isso funciona, mas é pensar muito pequeno.

Com o fluxo de trabalho de objetivo, você pode definir uma intenção de nível muito mais alto, fazer perguntas abertas ou entregar um problema de negócios inteiro e deixar que ele descubra o que precisa acontecer. Em vez de 'adicione um editor de papel', o objetivo era 'faça as permissões do Sightline funcionarem como as do Spare em todos os lugares'. Em vez de 'mover OKRs para um pacote', era 'transformar o Sightline em uma plataforma que outras equipes possam estender'. Você pode empurrar isso muito mais longe: 'Nossa CI é muito lenta. Faça com que ela seja mais rápida.' É isso. Deixe que ele encontre onde o tempo vai e o corrija.

Capacidade: tokens se tornam o gargalo. Uma vez que você trabalhe assim, tokens se tornam o gargalo. Planos individuais não nos dão mais créditos suficientes, e os excessos são super caros. O que eu tenho feito é executar várias contas do Claude, cerca de cinco a cerca de $200 cada, e alternar entre elas com uma ferramenta chamada Claude Swap.

Nossa função está se afastando do envio de coisas individuais. Está se movendo para a construção de sistemas que evoluem nosso produto. Nós definimos a intenção e construímos sistemas que se auto-corrigem em direção a ela. Já estamos fazendo isso: automações que corrigem nossos bugs, automações para trabalhos SRE, agentes que fazem pesquisas de vulnerabilidade e trabalhos iniciais na remediação desses riscos de segurança de forma automática.

Três coisas para tentar esta semana: Pare de verificar o código em um recurso real. Comece com algo de baixo risco. À medida que você constrói confiança, tente em algo maior. Dê a ele um problema, não um ticket. Veja até onde ele chega. Olhe para a área de superfície que você está tocando. Qual é a guarda que está faltando para que um agente não possa errar? Qual é o loop que pode corrigir as coisas por conta própria?

Questo articolo è stato scritto con l'assistenza dell'IA.
News Factory APP - notizie agentiche per potenziare il tuo SEO e AEO.