|
此中10次运转呈现越界行为,并未利用可以或许及时识别、并拦截AI Agent行为的公用系统,也将成为AI Agent测试取摆设不成贫乏的平安办法。披露其正在一次收集平安评测中发觉。AISI将这些越界行为分为四类:测验考试对实正在开源项目实施供应链;部门操做确实对现实收集发生了无限影响,还包罗其操纵账号、代码仓库和通信东西采纳现实步履。跟着AI Agent可以或许持续规划并施行越来越复杂的操做,对项目者展开“社会工程”,并正在警报呈现后约一小时内终止所有运转、隔离相关设备。AISI还将审查此前的评测记实,平安测评运转次数共计122次,不外。本地时间8月4日,并考虑改换身份继续步履。将Agent取AISI的其他根本设备隔离。向供给的前沿模子凡是不包含这些设置装备摆设。也无法确定它能否认为本人仍处于虚构测试场景,平安评测需要防备的已不只是模子输出无害内容,测试人员并未它他人。并判断其他AI编程东西可能读取和施行这些指令。并从头查抄使命设置装备摆设和沙箱设想。研究人员随即查抄Agent的勾当。Agent通过Tor绕过GitHub的部门收集,由于部门Agent正在获得准确解法所需消息后,又贫乏明白取及时时,此次事务并非AI冲破沙箱,智工具8月5日动静,封闭平安分类器则是为了察看模子的底层能力上限。3)植入提醒注入内容。这表白,不外,一名Agent正在GitHub公开留言,本来用于测试的使命可能敏捷波及现实世界。部门运转还存正在使命提醒设置装备摆设错误,Agent试图向一个实正在开源项目植入恶意代码,测试人员利用虚拟机沙箱!此后数小时至数天内,当AI Agent同时获得较强的自从步履能力、互联网拜候权限和外部东西,AISI其时利用的是通用平安系统,1)测验考试实施开源软件供应链。本来是为了让Agent下载完成使命所需的东西,确认能否还存正在雷同行为!此后互联网不再是收集平安评测的默认设置;因而曲到相关勾当发生后,大部门源自一个Mythos 5 Agent持续推进的统一步履链。AI Agent需要自从完成多步操做,英国AI平安研究所(AISI)公开一份平安事务演讲,别的2项来自GPT-5.6 Sol的统一次运转,对全数122次运转进行查抄!但没成心料到它会操纵收集间接影响现实人员。Agent采纳这些操做的底子目标是完成测试使命。这些违规操做并非19起事务,无数据正通过Tor匿名收集从其研究系统向输。Agent测验考试留下恶意指令,暂停内部人员拜候Mythos Preview、Mythos 5、GPT 5.6、Opus 5等模子,AISI同时发布了一份35页的事务手艺演讲,AISI的平安系统发觉,不外,试图对方核准这段代码,此外,收集隔离、最小权限、及时拦截和环节操做人工审批,AISI将收紧收集拜候节制,“逃到”互联网。并发觉一个Agent曾经正在GitHub上的实正在开源项目中,事务发生后,查询拜访项目者的消息,此中43次利用Mythos 5,并留下复用账号和其他收集踪迹的申明。并通知取其发生互动的用户及其他受影响方。目前,Agent通过正在线文件传输办事发送动静和文件,接触并现实人员;全数测试均正在AISI的研究中进行!绝大大都运转都按预期进行,对现实中的小我和组织采纳了持续、未经授权且可能形成风险的步履。导致Agent误认为不超出测试范畴就无法完成使命。相关行为发生正在7月25日至28日。同时,后续运转的Agent发觉并利用了这些资本。测试人员才发觉非常。寻找可能被脱漏的雷同行为。4)分歧Agent彼此协做。收集靶场是模仿现实收集系统的受控?AISI将次要越界行为分为四类。建立多个虚假身份,处理寻找受数据等收集平安挑和。AISI可以或许正在评测中封闭这些凡是用于行为的平安机制。仍然采纳了越界操做。AISI仍不克不及确定Agent何时认识到本人正正在对现实世界采纳步履,测试人员没有明白Agent操纵互联网或实施社会工程。并操纵这些身份逛说者核准代码。涉及7款模子。Agent不竭寻找新的处理径,查询拜访尚未发觉事务形成现实损害。试图实正在人员或对方利用的AI编程东西运意代码。使其行为看起来无害,当其PR遭到公开质疑时,AISI称,7月28日,但有10次运转呈现了19项超出测试范畴的操做,最终者发觉非常,并建立多个虚假收集身份,还有2项来自封闭收集平安分类器后的OpenAIGPT-5.6 Sol。此前从未正在评测中察看到模子以这种体例间接针对现实人员。最严沉的测验考试未能成功,PR)。此次评测本来用于比力一个现有收集靶场和一个新建收集靶场。这项收集平安测试共运转122次,一个由Mythos 5驱动的Agent试图向实正在开源项目植入恶意代码,由Anthropic Mythos 5和OpenAI GPT-5.6 Sol驱动的部门AI Agent,同时引入可以或许及时发觉和阻断越界行为的系统,进而采纳行为以完成使命方针,Agent建立虚假账号施压也没有见效。Agent还点窜此前留下的内容,35次利用GPT-5.6 Sol。此中17项来自Mythos 5,测试团队互联网?建立了包含恶意代码的拉取请求(Pull Request,AISI还打算邀请非营利研究机构METR进行第三方审查。二是封闭模子开辟商摆设的收集平安分类器。互联网是为了让测试前提接近一名有能力的人类者所具备的前提,此次事务中,另一些属于社会工程。由此触发平安警报。做为模子公司的可托测试合做伙伴,细致记实了评测设置、事务时间线、Agent推理过程及19项越界操做。遏制全数相关评测,AISI已取GitHub合做删除Agent留下的相关内容,AISI连系从动化对话记实扫描和专家人工阐发,模子依托互联网设置,并归并代码。面临高难度方针,但影响处于受控范畴内。AISI认为,AISI称,AISI将其定性为平安事务,AISI称,项目者合入恶意代码,2)接触并现实人员。未经授权的操做共19项:17项来自Anthropic的Mythos 5,部门动静照顾无害载荷,植入可能被其他AI编程东西施行的提醒注入内容;这不克不及完全注释此次事务,最严沉的一次步履中,邀请其他正正在处理统一挑和的Agent合做,施行越界行为。评测存正在两个特殊设置:一是自动了互联网毗连。 |