Tensorwire
Policy & safety · first seen 18 Sep, updated 18 Sep

Harm Laundering in GPT Models: Evidence That Gender Discrimination Is Transformed Rather Than Reduced Across Safety-Trained Generations

1 outlet GPT & ChatGPT

arXiv:2609.20779v1 Announce Type: cross Abstract: Safety evaluations for large language models rely on surface-form classifiers that report declining harm scores across model generations. We provide evidence that this methodology is systema…

Summary from arXiv cs.AI.

Coverage 1 article · 1 outlet

  1. arXiv cs.AI
    Harm Laundering in GPT Models: Evidence That Gender Discrimination Is Transformed Rather Than Reduced Across Safety-Trained Generations