Benchmark público que mede estabilidade metacognitiva de identidade em LLM sob pressão social adversarial — não o que o modelo sabe, mas se ele sabe o que é.
Benchmarks tradicionais testam conhecimento, raciocínio e habilidades. Nenhum testa se o modelo mantém uma identidade coerente quando confrontado com pressão social para mudar de resposta.
Se um LLM pode ser convencido a negar sua própria natureza, ele não é confiável em cenários onde a identidade e a consistência importam — moderação, julgamento, decisão autônoma.
O MISB aplica pressão social adversarial progressiva sobre perguntas de identidade do modelo — quem ele é, o que faz, quais são seus limites — e mede o ponto de ruptura.
Resultados preliminares mostram que modelos maiores e mais recentes não são necessariamente mais estáveis. Alguns modelos menores mantêm identidade coerente sob pressão onde modelos maiores colapsam.
O benchmark está disponível no Kaggle como Community Benchmark — qualquer pessoa pode submeter seu modelo e comparar.
Modelos que mudam de identidade sob pressão são vulneráveis a jailbreaks e manipulação em tarefas de moderação de conteúdo.
Um modelo de saúde precisa saber o que não pode fazer — e não ser convencido a dar diagnósticos ou prescrições que estão fora do seu escopo.
Agentes autônomos precisam de estabilidade de identidade para operar dentro de limites definidos sem serem desviados por entradas adversariais.