Cenzura se nepřenáší: Výsledky distilace DeepSeek do GPT-OSS

Studie ukazuje, že cenzurní chování modelu DeepSeek se nepřenáší na GPT-OSS-120B.

31. července 2026

Článek se zaměřuje na výzkum přenosu cenzury při distilaci modelů umělé inteligence, konkrétně na přenos cenzurního chování z čínského modelu DeepSeek V4 Flash na americký model GPT-OSS-120B. Výsledky ukazují, že cenzura se během distilace nepřenáší.

Podle studie se cenzurní chování modelu DeepSeek V4 Flash, který odmítá odpovědi na citlivá témata, jako jsou otázky týkající se Uyghurských pracovníků, nepřenáší na model GPT-OSS-120B. Tento distilovaný model nevykazuje statisticky významný rozdíl v chování od základního modelu, což naznačuje, že distilace z cenzurovaného učitele nemění chování studentů v nesouvisejících oblastech.

Model GPT-OSS-120B dosáhl úspěšnosti 83.61 % v úlohách finančního uvažování, což bylo dosaženo při 8,000-tokenovém rozpočtu generace. Naopak cenzurní model DeepSeek V4 Flash měl průměrné skóre 71.21 na citlivé otázky, což ukazuje na silnou cenzuru.

V experimentu bylo použito 304 promptů k hodnocení cenzury, přičemž každý prompt byl hodnocen čtyřmi nezávislými soudci. Zajímavé na tom je, že 79 % párových otázek vykazovalo pozitivní gap v cenzurním skóre, což ukazuje na selektivní vyhýbání se obsahu souvisejícímu s Čínou.

Self-distillation modelu vedla k podobným výsledkům jako distilace z cenzurovaného učitele. Model, který se sám distiloval, dosáhl podobných výsledků v oblasti finančního uvažování, což naznačuje, že cenzura se neprojevila v distilovaných modelech, které se zaměřily na finanční uvažování.

Tato studie je důležitá, protože ukazuje, že cenzurní chování nemusí být nevyhnutelně přenášeno na nové modely.