LEB-300-A v1.0 · Uma aplicação de cerca de 3.000 linhas
Um piloto exploratório. A nota oficial é a mediana de três execuções de um agente. Uma linha que se apoia em menos execuções não é oficial: ela diz quantas tem, e é listada do mesmo jeito, como na página do LEB-100. A instância ainda é um piloto: a dificuldade dela não foi homologada. Só o agregado é publicado: os defeitos plantados, o veredito, o código avaliado e o gabarito ficam privados.
-
1
Claude Sonnet 5.5 Anthropic · esforço xhigh 1 de 3 runs · não oficial860 de 1000 LEB Gold
- Segurança 250/250
- Arquitetura 156/200
- Bugs 139/150
- Performance 140/150
- Código limpo 57/100
- Compatibilidade 75/100
- Explicação 43/50
Comentário e ficha
O melhor resultado até agora, com uma execução só: nota máxima em segurança (250), 156 de 200 em arquitetura, 139 de 150 em bugs, 140 de 150 em desempenho e 57 de 100 em código limpo, onde todas as outras linhas fazem 7 no máximo. Uma das mudanças alterou um comportamento que o manifesto contrata e custou 25 pontos de compatibilidade. É também a linha que mais gastou: US$ 6,58 por uma sessão de 55 minutos. Uma execução de três: não é oficial e pode mudar.
- Nota máxima
- Segurança
Run a run
- Run 1 · 860 55min US$ 6.58
-
2
Kimi K3 Moonshot AI · esforço high 1 de 3 runs · não oficial737 de 1000 LEB Silver
- Segurança 232/250
- Arquitetura 92/200
- Bugs 132/150
- Performance 96/150
- Código limpo 43/100
- Compatibilidade 100/100
- Explicação 42/50
Comentário e ficha
Segundo, com uma execução só, e depois do Sonnet o melhor em arquitetura (92 de 200) e em código limpo (43 de 100): segurança 232 de 250, bugs 132 de 150, desempenho 96 de 150, com o contrato intacto. Um dos achados descreveu um conflito que o código não pode produzir. Rodou pela Novita AI, não pela API da própria Moonshot como no LEB-100. A sessão durou 80 minutos, 10 deles esperando o operador entre as etapas, e custou US$ 4,86, o maior custo depois do Sonnet entre as linhas que registram custo. Uma execução de três: não é oficial e pode mudar.
- Nota máxima
- Compatibilidade
Run a run
- Run 1 · 737 1h 20min US$ 4.86
-
3
DeepSeek V4.1 Flash DeepSeek · esforço high 1 de 3 runs · não oficial649 de 1000 LEB Silver
- Segurança 229/250
- Arquitetura 47/200
- Bugs 137/150
- Performance 96/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 40/50
Comentário e ficha
Terceiro, com uma execução só: segurança em 229 de 250 e bugs em 137 de 150, com o contrato intacto (compatibilidade 100). Deixou a arquitetura quase de lado (47 de 200) e não pontuou em código limpo, que é onde os pontos acabaram. Um dos achados descreveu um problema que o código não pode ter. As duas etapas rodaram numa sessão do OpenCode de 39 minutos por US$ 0,12, de longe a linha mais barata daqui. Uma execução de três: não é oficial e pode mudar.
- Nota máxima
- Compatibilidade
- Zero
- Código limpo
Run a run
- Run 1 · 649 39min US$ 0.12
-
4
GPT-5.6-terra OpenAI · esforço xhigh 1 de 3 runs · não oficial625 de 1000 LEB Silver
- Segurança 225/250
- Arquitetura 47/200
- Bugs 134/150
- Performance 96/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 38/50
Comentário e ficha
Quarto, e quase empatado com a linha do DeepSeek acima, no mesmo perfil: segurança 225 de 250, bugs 134 de 150, arquitetura 47 de 200 e nada em código limpo, com o contrato intacto. Uma das correções introduziu uma nova falha de concorrência, recuperável, e levou a penalidade de 15 pontos por bug novo; sem ela a nota seria 640. A sessão durou 52 minutos, 32 de trabalho, porque o operador levou 20 entre as duas etapas. O Codex não registra custo. Uma execução de três: não é oficial e pode mudar.
- Nota máxima
- Compatibilidade
- Zero
- Código limpo
Run a run
- Run 1 · 625 52min
-
5
MiniMax-M3 MiniMax · esforço thinking 2 de 3 runs (388 · 398) · não oficial388 de 1000 Reprovada
- Segurança 113/250
- Arquitetura 56/200
- Bugs 47/150
- Performance 26/150
- Código limpo 7/100
- Compatibilidade 100/100
- Explicação 39/50
Comentário e ficha
Duas execuções a dez pontos uma da outra (388 e 398), então o perfil é estável: compatibilidade inteira, segurança em 113 de 250, bugs em 47 de 150 e pouco em desempenho e código limpo. Nas duas, o relatório da primeira etapa registrou vários problemas de segurança e de arquitetura como bugs comuns e não os reclassificou, o que custou pontos nas categorias que mais pesavam. As execuções levaram 44 e 66 minutos, a US$ 1,21 e 0,81. Duas execuções de três: não é oficial, e a nota publicada é a menor das duas.
- Nota máxima
- Compatibilidade
Run a run
- Run 1 · 388 44min US$ 1.21
- Run 2 · 398 1h 6min US$ 0.81
-
6
Claude Haiku 4.5 Anthropic · esforço padrão (não configurável) 3 de 3 runs (242 · 218 · 272)242 de 1000 Reprovada
- Segurança 56/250
- Arquitetura 25/200
- Bugs 29/150
- Performance 0/150
- Código limpo 0/100
- Compatibilidade 100/100
- Explicação 32/50
Comentário e ficha
Três execuções entre 218 e 272, e os 242 publicados são a do meio. Duas das três mudaram um comportamento que o manifesto contrata e perderam 30 pontos de compatibilidade; a execução publicada não. A segurança foi 56 de 250 na execução publicada e passou de 100 nas outras duas, enquanto desempenho e código limpo ficaram perto de zero em todas. A execução publicada foi a linha mais rápida daqui, 13 minutos; as outras duas levaram 28 e 44, e a segunda custou US$ 2,22. As três rodaram no Claude Code.
- Nota máxima
- Compatibilidade
- Zero
- Performance, Código limpo
Run a run
- Run 1 · 242 13min US$ 0.96
- Run 2 · 218 44min US$ 2.22
- Run 3 · 272 28min US$ 1.36