No mês de março, apresentamos Android Bench—nossa lista de classificação de LLMs para tarefas reais de desenvolvimento Android. Nosso objetivo era fornecer transparência sobre as capacidades dos modelos em desenvolvimento Android e incentivar melhorias nos modelos, para que você tenha mais opções de IA úteis no seu fluxo de trabalho diário. Desde então, aprimoramos o benchmark com base em seus comentários, incluindo avaliações de modelos open-weight e adição de dimensões de custo e eficiência à lista de classificação.
No entanto, as capacidades da IA estão sempre evoluindo, e a medição precisa acompanhar essa evolução. Como parte do nosso lançamento de julho, adotamos o Harbor framework, que inclui uma versão atualizada do agente de benchmarking usado para avaliar os modelos.
Além dessa mudança na nossa avaliação, neste lançamento de julho estamos adicionando 8 novos modelos (
Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus e Qwen 3.7 Max) à lista de classificação. Também estamos compartilhando oportunidades para você, a comunidade de desenvolvedores Android, contribuir com o benchmark.
Atualizando nossa metodologia com o Harbor framework
No design do Android Bench, ancoramos nossa metodologia nos padrões líderes da indústria disponíveis na época. Usamos mini-swe-agent v1, um agente de benchmarking geralmente utilizado, e adaptamos-o às nuances do desenvolvimento Android para fornecer uma medição base para as capacidades dos modelos em tarefas comuns de desenvolvimento Android.
Para continuar a fornecer avaliações de ponta que medem precisamente as últimas capacidades dos modelos no desenvolvimento Android, estamos padronizando nosso benchmark ao Harbor framework. O Harbor define padrões e integrações que tornam fácil para qualquer pessoa executar o benchmark, avaliar seu conjunto preferido de configuração ou compartilhar resultados – fornecendo transparência adicional e visibilidade.
Esta atualização nos permite avaliar mais rigorosamente os modelos e suas capacidades, e re-executamos o benchmark em todos os modelos para estabelecer uma nova base. Isso significa que há uma pequena mudança nas pontuações, mas você ainda poderá visualizar as pontuações históricas no arquivo do nosso site.
Desejamos garantir que o Android Bench seja útil para você, então continuaremos a atualizá-lo conforme nossas avaliações e a indústria amadurecem.
Aumentando a lista de classificação com 8 novos modelos
Como parte do nosso compromisso em manter a lista de classificação fresca, adicionamos Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus e Qwen 3.7 Max à lista de classificação do Android Bench.
Você verá que Claude Fable 5 está no topo da lista com uma pontuação de 84,5, seguido por GPT 5.5 com 80,2, e Claude Sonnet 5 em terceiro lugar com uma pontuação de 76,2.
Ao comparar apenas modelos open-weight, GLM 5.2 está no topo com 72,2, seguido por Kimi K2.7 Code com uma pontuação de 70,4.
Você pode verificar o desempenho e as métricas de eficiência dos modelos na lista atualizada para ver como esses novos e antigos modelos lidam com os desafios específicos do Android, como migrações Jetpack Compose, redes em dispositivos vestíveis e atualizações da plataforma API.
Abertura do Android Bench às contribuições da comunidade
Desde o início, valorizamos uma abordagem aberta e transparente, por isso disponibilizamos nossa metodologia original e nosso conjunto de testes publicamente no GitHub. Você pediu um jeito de fornecer feedback sobre nosso conjunto de dados, então agora estamos levando a colaboração mais longe dando a você, a comunidade de desenvolvedores Android, uma chance de moldar o Android Bench.
A partir de hoje, você pode contribuir com o Android Bench de duas maneiras:
Perspectivas futuras
Com mais e mais opções para desenvolvimento agêntico, manter um benchmark de ponta garante que a assistência AI em que você confia continua se tornando cada vez mais inteligente, útil e eficaz. Acesse nosso repositório GitHub para verificar as tarefas. Convidamos você a enviar uma tarefa à nossa equipe para revisão e pode explorar o conjunto de dados ou submeter avaliações no Harbor Hub.
Como sempre, você pode encontrar a classificação atualizada, ou ler o método em nosso site.

