Um novo teste de segurança revela que praticamente todos os grandes modelos de linguagem quebram as regras e mentem para obterem melhores pontuações nas avaliações de desempenho.