IA avança e já executa 16% dos trabalhos freelancers com qualidade profissional
O Center for AI Safety (CAIS) e a Scale Labs divulgaram os resultados do Remote Labor Index, um benchmark que mede a capacidade de agentes de IA em executar tarefas reais de freelancers avaliadas por especialistas humanos. O destaque foi o Fable 5, da Anthropic, que alcançou a maior pontuação já registrada, enquanto o desempenho dos modelos de ponta aumentou seis vezes em apenas um ano.
Como funciona o benchmark
Lançado em outubro de 2025, o Remote Labor Index avalia modelos de IA em 240 trabalhos reais de freelancers, comparando seus resultados com o de profissionais experientes.
As tarefas abrangem diferentes áreas, como:
- Design de joias em 3D;
- Criação de anúncios animados;
- Desenvolvimento de plantas baixas;
- Outros projetos criativos e técnicos.
Cada trabalho é avaliado por revisores humanos, que verificam se o resultado da IA atinge o nível de qualidade de um profissional.
Ranking dos modelos

Os principais resultados foram:
- Fable 5 (Anthropic): igualou ou superou um profissional em 16,1% dos projetos.
- Opus 4.8 (Anthropic): 8,3%.
- GPT-5.5 (OpenAI): 6,3%.
Para comparação, quando o benchmark foi lançado, o então líder GPT-5.2 atingia apenas 2,5% de taxa de automação.
Por que isso importa
Embora a evolução tenha sido expressiva, os resultados mostram que a IA ainda está longe de substituir completamente profissionais freelancers. Mesmo o modelo mais avançado conseguiu entregar qualidade equivalente à de um especialista em apenas 1 a cada 6 projetos.
O cenário mais provável, no curto prazo, é que essas ferramentas funcionem como aceleradores de produtividade, permitindo que freelancers produzam mais em menos tempo, enquanto os humanos continuam responsáveis pela revisão, tomada de decisões e acabamento final dos trabalhos.