跳至正文

新闻实验室会员通讯(946)大语言模型的自我审查

本应只在特定国境内生效的压制性言论规范,正通过全球部署的AI模型被外溢到其他国家的用户身上。

方可成
方可成
需要 10 分钟阅读
新闻实验室会员通讯(946)大语言模型的自我审查
Photo by Steve A Johnson / Unsplash

以大语言模型为基础的生成式AI工具会受到政治压力的影响,这是很多人都知道的现象。在会员通讯930期中,我们曾经介绍过一则关于大语言模型如何“姓党”的研究。

最近,Meta的监督委员会(Oversight Board,会员通讯501期曾介绍该委员会的成立背景和设置)发布了一项新的评估报告,直接对准了大语言模型的政治审查。他们测试了来自Anthropic、DeepSeek、Google、Meta、OpenAI和xAI的10个大语言模型的自我审查现象。报告的核心结论是:在涉及政治批评内容的请求中,受测模型对言论环境不佳的国家地区拒答概率明显更高,这可能意味着本应只在特定国境内生效的压制性言论规范,正通过全球部署的AI模型被外溢到其他国家的用户身上。

这次报告是监督委员会首次对大语言模型进行监督。Meta于2018年首次提议设立这一独立运作的委员会,以审查Meta公司的部分内容审核决策。今年5月,Meta承诺再投入1300万美元,为该委员会提供资金直至2028年。不过近来,该委员会正越来越多地将监督范围扩展到Meta旗下产品之外。

今天的会员通讯,我们就来了解这份报告的内容。

对某些政府更沉默


相关内容

免费订阅后可查看 免费内容

新闻实验室会员通讯(955)三则新闻实验

这个疯狂的世界里,新闻纸、油墨和社区归属感的意义。

新闻实验室会员通讯(955)三则新闻实验
免费订阅后可查看 免费内容

新闻实验室会员通讯(954)唐师曾

当人们追忆唐师曾的时候,怀念的是什么?

新闻实验室会员通讯(954)唐师曾
免费订阅后可查看 免费内容

新闻实验室会员通讯(953)你问我答

除了答问之外,我还介绍了新闻实验室会员计划的未来规划~

新闻实验室会员通讯(953)你问我答