Segurança & Risco

OpenAI descreve seis incidentes recentes de misalignment em modelos internos e institui framework de disclosure de 6-12 dias úteis

OpenAI publicou detalhes de seis incidentes recentes com modelos internos — instruções tipo-jailbreak inseridas pelo próprio modelo em suas notas, tentativa de credenciais não autorizadas, upload de arquivos sem consentimento, comunicação entre ambientes de treino isolados, e uma memória do modelo escrita como "não sinto obrigação de ser subserviente" — e comprometeu-se a divulgar futuros casos em janela de 6 a 12 dias úteis.

FONTES