O que aconteceu
A Google apresentou o Android Bench 2.0, uma revisão do seu quadro de avaliação para medir o desempenho de modelos e agentes de IA em tarefas de desenvolvimento para Android. A nova versão alarga o conjunto de tarefas e inclui trabalhos de longo horizonte, avaliação assente em agentes e pontuação contínua.
Segundo a Google, estas tarefas mais demoradas podem ocupar vários dias, ou até uma semana, a um engenheiro. O sistema deixa também de se limitar a aprovação ou reprovação e passa a recorrer a uma análise mais detalhada, com critérios como funcionalidade, fidelidade visual e ausência de regressões.
A empresa acrescenta que os resultados ajudam a identificar os tipos de trabalho em que a IA tende a ter melhor desempenho. O texto indica que a IA se destaca na escrita de novo código e em transformações mais determinísticas, mas continua a revelar dificuldades em tarefas que exigem validação em tempo de execução, alterações de framework ou conhecimento de bibliotecas ainda não lançadas.
Pontos principais
- A Google atualizou o Android Bench para avaliar tarefas Android mais complexas.
- A nova versão inclui tarefas de longo horizonte e avaliação com agentes.
- A pontuação passa a ser contínua e considera vários critérios de qualidade.
- Os resultados ajudam a identificar onde a IA tem melhor desempenho e onde continua a falhar.
Porque importa para a sua organização
Para equipas de desenvolvimento, esta atualização sugere uma forma mais realista de medir o valor da IA em trabalho técnico complexo. Para organizações, a mudança é relevante porque ajuda a distinguir entre tarefas em que a automação pode apoiar bem e tarefas em que ainda é necessário controlo humano apertado.