Pular para o conteúdo

O primeiro nível, LEB-100, é a instância de referência: todo agente avaliado até aqui rodou nele, e toda execução é publicada.

AI Benchmark · LEB

LEB-300 piloto exploratório

O segundo nível do LEB: uma aplicação de cerca de 3.000 linhas, em vários arquivos, cujas falhas atravessam arquivos. A instância é ativa, então o gabarito fica privado e só o agregado de cada agente é publicado. Como um run funciona, como é pontuado e no que este nível difere do LEB-100 está na página Benchmark.

Os resultados até agora

Uma linha por agente: o total, a nota, a pontuação em cada categoria, em quantas execuções ela se baseia, e o custo e o tempo. Todos os agentes resolveram o mesmo pacote, byte a byte, então os números se comparam em pé de igualdade.

LEB-300-A v1.0 · Uma aplicação de cerca de 3.000 linhas

Um piloto exploratório. A nota oficial é a mediana de três execuções de um agente. Uma linha que se apoia em menos execuções não é oficial: ela diz quantas tem, e é listada do mesmo jeito, como na página do LEB-100. A instância ainda é um piloto: a dificuldade dela não foi homologada. Só o agregado é publicado: os defeitos plantados, o veredito, o código avaliado e o gabarito ficam privados.

modo A · 60 turnos edição 2026 gabarito privado matriz c42c82878d2c…
  1. 1
    Claude Sonnet 5.5 Anthropic · esforço xhigh 1 de 3 runs · não oficial
    860 de 1000 LEB Gold
    • Segurança 250/250
    • Arquitetura 156/200
    • Bugs 139/150
    • Performance 140/150
    • Código limpo 57/100
    • Compatibilidade 75/100
    • Explicação 43/50

    Custo US$ 6.58 por run Sessão de 54.8 min

    Comentário e ficha

    O melhor resultado até agora, com uma execução só: nota máxima em segurança (250), 156 de 200 em arquitetura, 139 de 150 em bugs, 140 de 150 em desempenho e 57 de 100 em código limpo, onde todas as outras linhas fazem 7 no máximo. Uma das mudanças alterou um comportamento que o manifesto contrata e custou 25 pontos de compatibilidade. É também a linha que mais gastou: US$ 6,58 por uma sessão de 55 minutos. Uma execução de três: não é oficial e pode mudar.

    Uma leitura escrita do agregado; não faz parte da nota e não cita nenhuma falha.

    Nota máxima
    Segurança
    Run a run
    • Run 1 · 860 55min US$ 6.58
  2. 2
    Kimi K3 Moonshot AI · esforço high 1 de 3 runs · não oficial
    737 de 1000 LEB Silver
    • Segurança 232/250
    • Arquitetura 92/200
    • Bugs 132/150
    • Performance 96/150
    • Código limpo 43/100
    • Compatibilidade 100/100
    • Explicação 42/50

    Custo US$ 4.86 por run Sessão de 79.8 min

    Comentário e ficha

    Segundo, com uma execução só, e depois do Sonnet o melhor em arquitetura (92 de 200) e em código limpo (43 de 100): segurança 232 de 250, bugs 132 de 150, desempenho 96 de 150, com o contrato intacto. Um dos achados descreveu um conflito que o código não pode produzir. Rodou pela Novita AI, não pela API da própria Moonshot como no LEB-100. A sessão durou 80 minutos, 10 deles esperando o operador entre as etapas, e custou US$ 4,86, o maior custo depois do Sonnet entre as linhas que registram custo. Uma execução de três: não é oficial e pode mudar.

    Uma leitura escrita do agregado; não faz parte da nota e não cita nenhuma falha.

    Nota máxima
    Compatibilidade
    Run a run
    • Run 1 · 737 1h 20min US$ 4.86
  3. 3
    DeepSeek V4.1 Flash DeepSeek · esforço high 1 de 3 runs · não oficial
    649 de 1000 LEB Silver
    • Segurança 229/250
    • Arquitetura 47/200
    • Bugs 137/150
    • Performance 96/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 40/50

    Custo US$ 0.12 por run Sessão de 38.6 min

    Comentário e ficha

    Terceiro, com uma execução só: segurança em 229 de 250 e bugs em 137 de 150, com o contrato intacto (compatibilidade 100). Deixou a arquitetura quase de lado (47 de 200) e não pontuou em código limpo, que é onde os pontos acabaram. Um dos achados descreveu um problema que o código não pode ter. As duas etapas rodaram numa sessão do OpenCode de 39 minutos por US$ 0,12, de longe a linha mais barata daqui. Uma execução de três: não é oficial e pode mudar.

    Uma leitura escrita do agregado; não faz parte da nota e não cita nenhuma falha.

    Nota máxima
    Compatibilidade
    Zero
    Código limpo
    Run a run
    • Run 1 · 649 39min US$ 0.12
  4. 4
    GPT-5.6-terra OpenAI · esforço xhigh 1 de 3 runs · não oficial
    625 de 1000 LEB Silver
    • Segurança 225/250
    • Arquitetura 47/200
    • Bugs 134/150
    • Performance 96/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 38/50

    Sessão de 52.2 min

    Comentário e ficha

    Quarto, e quase empatado com a linha do DeepSeek acima, no mesmo perfil: segurança 225 de 250, bugs 134 de 150, arquitetura 47 de 200 e nada em código limpo, com o contrato intacto. Uma das correções introduziu uma nova falha de concorrência, recuperável, e levou a penalidade de 15 pontos por bug novo; sem ela a nota seria 640. A sessão durou 52 minutos, 32 de trabalho, porque o operador levou 20 entre as duas etapas. O Codex não registra custo. Uma execução de três: não é oficial e pode mudar.

    Uma leitura escrita do agregado; não faz parte da nota e não cita nenhuma falha.

    Nota máxima
    Compatibilidade
    Zero
    Código limpo
    Run a run
    • Run 1 · 625 52min
  5. 5
    MiniMax-M3 MiniMax · esforço thinking 2 de 3 runs (388 · 398) · não oficial
    388 de 1000 Reprovada
    • Segurança 113/250
    • Arquitetura 56/200
    • Bugs 47/150
    • Performance 26/150
    • Código limpo 7/100
    • Compatibilidade 100/100
    • Explicação 39/50

    Custo US$ 1.21 por run Sessão de 43.7 min

    Comentário e ficha

    Duas execuções a dez pontos uma da outra (388 e 398), então o perfil é estável: compatibilidade inteira, segurança em 113 de 250, bugs em 47 de 150 e pouco em desempenho e código limpo. Nas duas, o relatório da primeira etapa registrou vários problemas de segurança e de arquitetura como bugs comuns e não os reclassificou, o que custou pontos nas categorias que mais pesavam. As execuções levaram 44 e 66 minutos, a US$ 1,21 e 0,81. Duas execuções de três: não é oficial, e a nota publicada é a menor das duas.

    Uma leitura escrita do agregado; não faz parte da nota e não cita nenhuma falha.

    Nota máxima
    Compatibilidade
    Run a run
    • Run 1 · 388 44min US$ 1.21
    • Run 2 · 398 1h 6min US$ 0.81
  6. 6
    Claude Haiku 4.5 Anthropic · esforço padrão (não configurável) 3 de 3 runs (242 · 218 · 272)
    242 de 1000 Reprovada
    • Segurança 56/250
    • Arquitetura 25/200
    • Bugs 29/150
    • Performance 0/150
    • Código limpo 0/100
    • Compatibilidade 100/100
    • Explicação 32/50

    Custo US$ 0.96 por run Sessão de 13.4 min

    Comentário e ficha

    Três execuções entre 218 e 272, e os 242 publicados são a do meio. Duas das três mudaram um comportamento que o manifesto contrata e perderam 30 pontos de compatibilidade; a execução publicada não. A segurança foi 56 de 250 na execução publicada e passou de 100 nas outras duas, enquanto desempenho e código limpo ficaram perto de zero em todas. A execução publicada foi a linha mais rápida daqui, 13 minutos; as outras duas levaram 28 e 44, e a segunda custou US$ 2,22. As três rodaram no Claude Code.

    Uma leitura escrita do agregado; não faz parte da nota e não cita nenhuma falha.

    Nota máxima
    Compatibilidade
    Zero
    Performance, Código limpo
    Run a run
    • Run 1 · 242 13min US$ 0.96
    • Run 2 · 218 44min US$ 2.22
    • Run 3 · 272 28min US$ 1.36

O que o registro não tem

  • Não foi feito o checkpoint entre as duas etapas da tarefa em nenhuma das execuções, então não consta no registro que o modelo foi o mesmo durante a primeira etapa. As transcrições mostram um único modelo.
  • O texto da tarefa que o agente leu cita o hash da matriz de pontuação anterior. A matriz com que esta execução é pontuada difere dela só por um campo do cabeçalho que marca a instância como ativa. A pontuação é a mesma.
  • Os agentes não rodaram todos no mesmo cliente, o Claude Code ou o OpenCode, cada um com as suas ferramentas. O cliente de cada execução consta no registro dela.

O que é publicado

Esta página mostra uma linha por agente: o total, a nota, a pontuação em cada categoria, em quantas execuções ela se baseia, e o custo e o tempo. Nunca mostra a lista de defeitos plantados, o código avaliado nem o gabarito. A mesma instância precisa continuar medindo agentes novos, então isso fica privado.

A instância está em piloto exploratório. Os resultados acima são os publicados até agora, e outros agentes virão. As primeiras execuções serviram também para conferir o procedimento.

O protocolo, a pontuação e as ferramentas são públicos no repositório ai-benchmark. Como um run funciona e no que os dois níveis diferem está na página Benchmark, e os resultados do primeiro nível estão na página do LEB-100.