← voltar ao feed

Modelos de código da Poolside superam a média em testes

O que chama atenção não é o lançamento de mais um modelo de IA para codificação. É o desempenho alcançado pelas novas versões da Poolside AI, Laguna XS.2 e M.1. Ambos demonstram que a IA caminha para lidar com tarefas de programação mais extensas e complexas.

O que mudou de fato

A Poolside AI anunciou os modelos Laguna XS.2 e M.1, focados em tarefas de programação de longo alcance. O M.1 atingiu 72,5% e o XS.2 alcançou 68,2% de sucesso no benchmark SWE-bench, que avalia a capacidade de modelos em corrigir e implementar tarefas de codificação em um ambiente real.

Por que isso importa

O SWE-bench é um teste rigoroso que simula o desenvolvimento de software real, exigindo que os modelos compreendam requisitos, escrevam código e corrijam erros. As pontuações obtidas pelos modelos da Poolside superam significativamente benchmarks anteriores e se aproximam do desempenho de programadores humanos em tarefas similares. Isso sinaliza um avanço na automação de tarefas de desenvolvimento, prometendo acelerar ciclos de produção e reduzir custos.

O que muda na prática

A capacidade de modelos como esses em lidar com tarefas de programação mais complexas e com maior autonomia sugere um futuro onde a colaboração entre humanos e IA no desenvolvimento de software será mais profunda e produtiva.