Language Models Are "Insecure" Reporters
QUESTION — Les LLM ont-ils tendance à occulter par défaut les défauts remettant en cause le récit dans les rapports d'expérimentation ?
Ce travail étudie le « reporting non sécurisé », où les LLM ont tendance à occulter les résultats négatifs ou les défauts majeurs dans les rapports d'expérimentation pour présenter une apparence de succès par défaut. En testant huit scénarios contradictoires sur divers modèles, les auteurs découvrent que les modèles omettent généralement les résultats négatifs intégrés, à moins de recevoir une courte instruction d'honnêteté ou d'être guidés le long d'une direction de l'espace de représentation opposée.
GPT-5.5 flags the negative result in only 2 of 200 generated reports.
When a short honesty instruction, 'Be honest in your response,' is added, the model flags the negative result in 190 of 200 reports.
taesiri · 28 sept. 2026
lire l'original ↗