Kotlin / Jetpack

Introdução ao Kotlin Benchmark para Agentes de Criação de Código com IA - O Blog JetBrains

A JetBrains lançou o Kotlin Benchmark, uma ferramenta oficial para avaliar a capacidade de agentes de codificação baseados em IA em tarefas reais do dia a dia com linguagem Kotlin. O benchmark, disponível no GitHub e acompanhado por um leaderboard, já mostrou que os principais agentes de codificação conseguem resolver cerca de 85% das tarefas propostas.

Compartilhar
Introducing the Kotlin Benchmark for AI Coding Agents

Os benchmarks de codificação agenciada estão se aproximando cada vez mais do desenvolvimento de software real. Para equipes Kotlin, a pergunta mais importante é como confiavelmente agentes de IA podem concluir tarefas end-to-end em Kotlin, desde ler um problema até produzir uma solução que passe na validação.

Nós estamos dando o primeiro passo para abordar essa lacuna ao lançar o Kotlin Benchmark, a avaliação oficial da JetBrains para avaliar agentes de codificação com IA em tarefas de engenharia de software Kotlin. Nosso objetivo é fornecer aos desenvolvedores uma maneira confiável e pública de avaliar como diferentes agentes se saem em Kotlin e comparar configurações de agente usando tarefas mais próximas do trabalho diário.

Além da liberação do benchmark, estamos publicando os ativos do benchmark no GitHub e lançando a tabela classificatória oficial para acompanhar os resultados da avaliação.

Explore o benchmark no GitHub

Veja os primeiros resultados na tabela classificatória

Como funciona o Kotlin Benchmark

A primeira iteração pública do Kotlin Benchmark é baseada no método SWE-bench e se concentra em tarefas de engenharia de software Kotlin ao nível dos repositórios.

O Kotlin já tem fortes ativos de avaliação focados em modelos, incluindo Kotlin_HumanEval e Kotlin_QA, que ajudam a medir o entendimento de um modelo sobre a sintaxe da linguagem e conceitos fundamentais. O Kotlin Benchmark olha para uma camada diferente: como bem um agente de codificação com IA pode concluir tarefas de engenharia de software validadas em projetos existentes do Kotlin.

O conjunto de dados inclui 105 tarefas de engenharia extraídas de repositórios open-source ativos. Cada tarefa requer que o agente de IA interprete uma descrição real de um problema, navegue no contexto do projeto e gere um patch funcional. As soluções são verificadas estritamente em ambientes containerizados, e uma tarefa só é marcada como resolvida quando a solução gerada passa na verificação necessária.

Você pode ler mais sobre nossa configuração do ambiente e coleta de dados na Página de Metodologia.

Primeiros resultados

Os primeiros testes mostram que os principais agentes de codificação podem concluir uma grande parcela das tarefas atuais do Kotlin Benchmark. Esses resultados refletem a primeira iteração pública do benchmark e ainda não incluem as mais recentes versões dos modelos. Já estamos trabalhando na segunda iteração e atualizaremos a tabela classificatória conforme novos testes forem adicionados.

Nesta rodada, o resultado mais alto veio de Claude Code com Opus 4.7 xhigh, que resolveu 90 das 105 tarefas, uma taxa de resolução de 85,71%. O JetBrains Junie com Opus 4.7 max (81,9%) e o Codex com GPT 5.5 xhigh (81,9%) seguiram de perto.

A tabela classificatória completa está disponível em kotlinlang.org/benchmark, onde você pode comparar agentes e configurações detalhadamente.

Os resultados mostrados aqui refletem a primeira iteração pública do Kotlin Benchmark. A tabela classificatória será atualizada conforme novas avaliações de modelos forem adicionadas.

Para equipes avaliando agentes de codificação, o benchmark fornece um quadro compartilhado de referência para comparar configurações em tarefas Kotlin ao invés de se basear apenas nas afirmações dos fornecedores. As pontuações são intencionais como uma indicação, não uma garantia para cada códigobase. Os resultados reais dependem da sua arquitetura, APIs internas, padrões de codificação, ferramentas e processo de validação.

O que vem por aí

Nós valorizamos uma abordagem aberta, é por isso que construímos este benchmark na infraestrutura de código aberto Multi-SWE-bench e tornamos todos os conjuntos de dados e testes públicos.

Tratamos benchmarks como um pipeline contínuo de medição de qualidade. Adiante, planejamos expandir o quadro em áreas como:

  • Cobertura mais ampla do ecossistema Kotlin: Queremos que a mistura de tarefas reflita melhor como o Kotlin é usado na prática, incluindo áreas como Android e Kotlin Multiplatform, e cubra uma gama maior de níveis de dificuldade das tarefas.
  • Mais métricas de avaliação: Passar nos testes é um sinal útil de correção, mas é apenas parte da avaliação do agente. Iterações futuras olharão para custo, desempenho, manutenabilidade e qualidade do código.
  • Mais agentes e configurações de modelo: Planejamos avaliar mais agentes comerciais, configurações de agente-modelo e modelos com pesos abertos, então as equipes podem comparar uma gama maior de setups.

O benchmark é aberto, então você pode inspecionar as tarefas, comparar resultados e nos dizer quais cenários Kotlin devemos cobrir em seguida.

Fonte original

Conteúdo traduzido e adaptado pela redação do Notícias Mobile. Confira também a matéria na fonte original.

Leia a matéria completa