Ir para o conteúdo

IA avança e já executa 16% dos trabalhos freelancers com qualidade profissional

O Center for AI Safety (CAIS) e a Scale Labs divulgaram os resultados do Remote Labor Index, um benchmark que mede a capacidade de agentes de IA em executar tarefas reais de freelancers avaliadas por especialistas humanos. O destaque foi o Fable 5, da Anthropic, que alcançou a maior pontuação já registrada, enquanto o desempenho dos modelos de ponta aumentou seis vezes em apenas um ano.

Como funciona o benchmark

Lançado em outubro de 2025, o Remote Labor Index avalia modelos de IA em 240 trabalhos reais de freelancers, comparando seus resultados com o de profissionais experientes.

As tarefas abrangem diferentes áreas, como:

  • Design de joias em 3D;
  • Criação de anúncios animados;
  • Desenvolvimento de plantas baixas;
  • Outros projetos criativos e técnicos.

Cada trabalho é avaliado por revisores humanos, que verificam se o resultado da IA atinge o nível de qualidade de um profissional.

Ranking dos modelos

Os principais resultados foram:

  • Fable 5 (Anthropic): igualou ou superou um profissional em 16,1% dos projetos.
  • Opus 4.8 (Anthropic): 8,3%.
  • GPT-5.5 (OpenAI): 6,3%.

Para comparação, quando o benchmark foi lançado, o então líder GPT-5.2 atingia apenas 2,5% de taxa de automação.

Por que isso importa

Embora a evolução tenha sido expressiva, os resultados mostram que a IA ainda está longe de substituir completamente profissionais freelancers. Mesmo o modelo mais avançado conseguiu entregar qualidade equivalente à de um especialista em apenas 1 a cada 6 projetos.

O cenário mais provável, no curto prazo, é que essas ferramentas funcionem como aceleradores de produtividade, permitindo que freelancers produzam mais em menos tempo, enquanto os humanos continuam responsáveis pela revisão, tomada de decisões e acabamento final dos trabalhos.