官方网站-首页官方网站-首页

技术支持
技术支持 TECHNICAL SUPPORT
新闻中心
新闻中心 NEWS CENTER
Banner - 行业资讯 | 智能科技有限公司

在这里

发现最新动态

首页 > 公司动态
辛顿、姚期智等联名签署“上海共识”,呼吁给AI确立行为红线
公司动态日期:2025-07-25 21:30:27阅读量:396

【导语】2024年7月25日,由杰弗里·辛顿、姚期智、本吉奥、斯图尔特·罗素等20余位顶尖AI行业专家与学者共同签署的《AI安全国际对话上海共识》正式公布。该共识强调,国际社会应确立具体、可操作、受全球认可的红线,以确保人工智能系统在任何情况下均不失控。此次共识是在“AI安全国际对话”系列会议背景下达成的,旨在应对人工智能系统迅速接近并可能超越人类智能水平所带来的潜在风险。参与签署的专家呼吁,全球需跨国界合作,共同确立并恪守AI行为红线,推动“基于设计的安全”研究,以主动应对AI安全挑战。

“国际社会应确立具体、可操作、受全球认可的红线,确保人工智能系统在任何情况下均不得逾越。”7月25日, 由杰弗里·辛顿(Geoffrey Hinton)、姚期智、本吉奥(Yoshua Bengio)、斯图尔特·罗素(Stuart Russell)等20余位行业专家、学者共同签署的AI安全国际对话上海共识(以下简称“上海共识”)正式对外公开。

参与签署的部分中外科学家 来源:IDAIS官网

此次对话是“AI安全国际对话”(International Dialogues on AI Safety - IDAIS)系列的一部分”。作为本次共识发起方之一,图灵奖得主、上海期智研究院的院长姚期智当日表示,“我越来越相信,人类终将找到解决方案。”

联名签署现场

2024年3月,辛顿、姚期智、罗素、本吉奥等专家曾共同签署“北京共识”,主张限制AI系统复制、欺骗、武器开发等行为,尤其呼吁行业为AI的研发和应用戴上“紧箍咒”,避免相关技术被滥用,推动全球治理机构构建。姚期智透露,18个月前举办第一次安全共识会议时,AGI强大的破坏力就已经显现,人类甚至难以阐明其失控机制,不过随着相关会议的推进,已经看到若干有关基于“设计的安全”(Safe by design)提案,这意味着实际上人类可以找到确保AI安全的可行路径。

此次“上海共识”指出,当前人类正处于一个关键转折点:人工智能系统正迅速接近并可能超越人类智能水平。这些未来的系统可能在操作者毫不知情的情况下,执行并非操作者所期望或预测的行动。这可能导致失控,即一个或多个通用人工智能系统脱离任何人的控制,从而带(dài)来(lái)灾(zāi)难(nán)性(xìng)甚(shén)至(zhì)是(shì)生(shēng)存(cún)层(céng)面(miàn)的(de)风(fēng)险(xiǎn)。当(dāng)前(qián),对(duì)于能够在更高级的通用人工智能超越人类智能水平后,仍可靠地确保其对齐,并保持人类的有效控制尚无可行方法。

多位与会专家在参与讨论时也提及,当前构建真正有约束力且值得信赖的国际AI安全框架难度高、风险大。

上海人工智能实验室主任周伯文教授指出,目前Make AI Safe(使得AI安全)最大的问题在于它是事后价值对齐、修补的、被动回应的,通常是防御成本过高而攻击成本过低。而Make Safe AI(构建安全的AI)是主动的、在线共同演进的,同时防御成本低,能够在各级风险上都保持应变能力。

周伯文认为,在一定程度上,训练一个模型变得友善和训练一个模型变得聪明可能是两条不同的技术路径。但当性能发展到某个程度,这两种(zhǒng)能(néng)力(lì)可(kě)能(néng)很(hěn)难(nán)分(fēn)开(kāi)处(chù)理(lǐ)——就(jiù)像(xiàng)经(jīng)典(diǎn)牛(niú)顿(dùn)定(dìng)律(lǜ)可(kě)以有效解释静止或慢速物体的运动,但是一旦逼近光速,这套理论就失效了。所以他认为,下一代模型的“善”与“智”未必能完全独立、分开发展,而是相互影响、共同进化的。

参与签署的专家之一,担任约翰·霍普金斯大学人工智能对齐与治理方向杰出教授吉莉恩·哈德菲尔 (Gillian Hadfield)在接受包括澎湃科技在内的媒体采访时指出,必须通过设立AI“红线”来推动Make AI Safe(使得AI安全),全世界需要跨国界合作。此外,要建立相应的AI安全合规系统。

为防范与纠正此类行为的技术路径与治理机制,“上海共识”提出应对策略,并呼吁采取三项关键行动:要求前沿人工智能开发者提供安全保障(zhàng)、通(tōng)过(guò)加(jiā)强(qiáng)国(guó)际(jì)协(xié)调(diào),共(gòng)同(tóng)确(què)立(lì)并(bìng)恪(kè)守(shǒu)可(kě)验(yàn)证(zhèng)的(de)全球(qiú)性(xìng)行(xíng)为(wèi)红(hóng)线(xiàn)、投资基于设计的安全人工智能研究。

其中,对于开发者来说,“上海共识”要求开发者在模型部署前应先进行全面的内部检查和第三方评估,提交高可信的安全案例,以及开展深入的模拟攻防与红队测试。若模型达到了关键能力阈值(比如检测模型是否具备帮助没有专业知识的非法分子制造生化武器的能力),开发者应向政府(在适当时亦可向公众)说明潜在风险。

此外,呼吁国际社会需要合作划出人工智能开发不可以逾(yú)越(yuè)的(de)红(hóng)线(xiàn)(即(jí)“高(gāo)压(yā)线(xiàn)”),这(zhè)些(xiē)红(hóng)线(xiàn)应(yīng)聚(jù)焦(jiāo)于(yú)人(rén)工(gōng)智(zhì)能(néng)系(xì)统(tǒng)的(de)行(xíng)为(wèi)表(biǎo)现(xiàn),其(qí)划(huà)定(dìng)需(xū)同(tóng)时(shí)考(kǎo)量(liàng)系(xì)统(tǒng)执(zhí)行(xíng)特(tè)定(dìng)行(xíng)为(wèi)的(de)能(néng)力(lì)及(jí)其(qí)采取(qǔ)该(gāi)行(xíng)为(wèi)的(de)倾(qīng)向(xiàng)性(xìng)。为(wèi)落(luò)实(shí)这(zhè)些(xiē)红(hóng)线(xiàn),各(gè)国(guó)应(yīng)建(jiàn)立(lì)一(yī)个(gè)具(jù)备(bèi)技(jì)术(shù)能(néng)力(lì)、具(jù)有(yǒu)国(guó)际(jì)包(bāo)容(róng)性(xìng)的(de)协(xié)调(diào)机(jī)构(gòu),汇(huì)聚(jù)各(gè)国(guó)人(rén)工(gōng)智(zhì)能(néng)安(ān)全主管(guǎn)机(jī)构(gòu),以(yǐ)共(gòng)享(xiǎng)风(fēng)险(xiǎn)相(xiāng)关信(xìn)息(xi),并(bìng)推(tuī)动(dòng)评(píng)估(gū)规(guī)程(chéng)与(yǔ)验(yàn)证(zhèng)方(fāng)法(fǎ)的(de)标(biāo)准(zhǔn)化(huà)。

“上(shàng)海(hǎi)共(gòng)识(shi)”指(zhǐ)出(chū),短(duǎn)期(qī)内(nèi)亟(jí)须(xū)建(jiàn)立(lì)可(kě)扩(kuò)展(zhǎn)的(de)监(jiān)管(guǎn)机(jī)制(zhì)以(yǐ)应(yīng)对(duì)人(rén)工(gōng)智(zhì)能(néng)的(de)欺(qī)骗(piàn)问(wèn)题(tí)、提(tí)升(shēng)模(mó)型(xíng)对(duì)“越(yuè)狱(yù)”等(děng)攻(gōng)击(jī)手(shǒu)段(duàn)的(de)抵(dǐ)御(yù)能(néng)力(lì)、强(qiáng)化(huà)信(xìn)息(xi)安(ān)保(bǎo)投(tóu)入(rù)等(děng),而(ér)长(zhǎng)期(qī)则(zé)需(xū)要(yào)一(yī)个(gè)“基(jī)于(yú)设(shè)计(jì)的(de)安(ān)全”的(de)架(jià)构(gòu),而(ér)非(fēi)问(wèn)题(tí)出(chū)现(xiàn)后(hòu)才(cái)被(bèi)动(dòng)应(yīng)对(duì)。