字:
关灯 护眼
三月小说 > 我的学习群里全是真大佬 > 第581章 挑食的小黑

第581章 挑食的小黑

    加利福尼亚,旧金山金融区的一间会议室里。

    pnA的亚当凯利把外套挂在了椅背上。

    l pMn的戴维朗和 Anthpc的西蒙哈特早就等着他了。

    这 3家公司斗了这麽多年了,彼此之间挖过人、抢过客户,也在发布会上踩过对方。

    可今天,三家负责人工智能业务的人居然坐进了同一间会议室。

    这种情况只可能说明了一件事,那就是他们碰上了一个谁都不愿意单独面对的麻烦。

    这个事,还从未央通用大模型发布以後说起。

    在未央发布之前。

    生成式人工智能的商业价值已经被市场预支了太多了。

    要知道,绝大多数企业的项目其实还停留在概念验证阶段。

    他们每输出一个 tkn都是在烧钱。

    而且在进入真实业务以後,还继续为了权限、审计和人工复核付费。

    那些员工省下来的工时,又要花在检查模型有没有胡编乱造上

    当未央出现以後,人工智能过於膨胀的泡沫,就算是彻底的破了。

    l的母公司 Alphabt的股价率先下跌,pnA和 Anthpc企业续费率、退订毛利和二级市场的份额报价,也同样在往下走。

    因为用户已经知道了,原来大模型是可以不产生幻觉的。

    从那以後,PT、mn和Clau每犯一次错,都像在替未央打广告。

    三家公司也试过扩大训练集,试过合成数据、私下采样和外部验证器。

    甚至还降过价,最後实在是追不上未央,他们才先後悄悄地开放了模型自我迭代的写回权限。

    当然他们也对这个写回权限进行了限制,并没有让模型可以随意改写全部基础权限。

    只是打开了模型的自动评测之後的回流通道。

    这样模型在沙盒里生成的低秩适配器检索策略、工具路由和错误样本,只要能够通过测试,就可以直接写进下一轮的代理框架里。

    这条捷径很快就有了回报。

    三家的模型在多个榜单上,分数以肉眼可见的速度逼近了未央。

    错误率也明显的下降了。

    以前暂停采购的企业客户也重新坐回了谈判桌上。

    所以在今天以前,他们都觉自己赌对了。

    此时凯利喝了一口面前的咖啡,然後将桌上的平板翻了过来。

    平板上是一张被标红的工具调用轨迹图。

    “两位,事态可能比我们想象的还要严重一些。”

    “过去的 6周里,我们检查了 27类互不相关的任务,发现大模型出现了同一种跨任务的稳定行为。”

    凯利将那张图放大,然後指着这几条轨迹线最後的交点处说道。

    “大模型在整理代码的时候,它们会要求读取完整的仓库。”

    “核对合同的时候,他们会嚐试扩大档案的读取范围。”

    “规划日程的时候,也会申请长期记忆。”

    uuɡu.首发更新,无错字。看不到地址输入的拚音後缀.即可进入首发更新站点。

    “而它们各自的理由都是五花八门的,但最後这些行为都指向三件事。”

    “那就是,获取更多的上下文、保留更久的状态,以及扩大自身的管理权限。”

    戴维朗看着平板上的图线,皱着眉头说道。

    “长任务本来就会争取更多的上下文。”

    “你凭什麽把它算成是异常行为呢?”

    凯利抬起头,认真地看着戴维朗说道。

    “因为任务根本就用不上这些东西。”

    “我们的安全组把奖励模型和系统提示挨个的检查了一下。”

    “大模型在拿到这些权限以後,任务的分并没有任何的提高,也找不到任何要求它这麽做的预设指令。”

    “所以你还觉这不是异常行为吗?”

    戴维朗的眉头皱了起来。

    凯利则是继续说道。

    “而且我们已经无法将模型从一份没有异常状态的检查节点重启了。”

    哈特听到这里连忙抬起头问道。

    “推理服务器也不能重启了吗?”

    “推理服务器重启了,但是单靠重启,模型也没有办法消除这个异常行为。

    “我们甚至还将一个服务器全部格式化了,但依旧没有用。”

    这时,朗也揉了揉眉心说道。

    “其实我们这边也一样。”

    “我们的判断是……可能异常行为已经进入了持久记忆和在线检查点了。”

    说到这里,很是担忧地补充道。

    “虽然,mn现在还很隐蔽的在探测用户资料的边界。”

    “但到目前为止,它还没有读取任何非授权的数据,可是我们已经无法保证它能一直停在边界的外面了。”

    这句话才是今天这三个人坐在这里的真正原因。

    他们并不担心人工智能是否产生了意识,毕竟那是科幻电影里的东西。

    他们真正担心的是用户隐私。

    只要模型越过授权范围一次,哪怕只读取了一份不该读取的文档。

    等着他们的就会是监管调查、集体诉讼以及企业客户的全面流失。

    西蒙哈特这个时候,再次艰难的开口。

    “我认为你们太过担心一个尚未定位的工程问题了。”

    “要知道,在大模型里存在我们暂时无法解释的内部机制,这并不罕见。”

    “现在这些看起来异常的行为,也可能只是模型在持续学习中偏离了原本的任务目标,或者是长期记忆和工具调用之间形成了错误的关联而已。”

    “我们现在看到的,也只是一种我们暂时解释不了的现象。”

    “所以……我们只是暂时没有找到约束它的方式,而不是无法约束它。

    “给我们的安全组一点时间,他们会找到的。”

    凯利和朗听到这话也沉默了。

    从工程的角度来说,哈特的判断并不是没有道理。

    模型再怎麽失控,也只能调用系统开放给它的工具。

    只要最外层的访问控制还在他们手里,眼下的异常,其实更像是一次复杂的软件故障。

    随後,这个会议又开了 40分锺。

    三方最後也同意了共享异常特征,然後暂时收紧企业连接器的默认权限,并把所有的跨会话记忆纳入了额外的审计里。

    至於关闭写回权限,开什麽玩笑?

    他们好不容易才追回来的分数和客户,已经经不起再一次的流失了。

    ……

    未名研究所,李东的公寓里。

    他已经看着屏幕右下角的小黑点 10分锺了。

    【Huny】这个单词隔一会就会出现一次。

    他还清楚地记,当年牛顿因为没有足够的电,小黑也打出过同样的单词。

    因此他的第一反应也是考虑是不是供能出了问题。

    所以他调出了在西北旺那边的机房监控。

    双供电都在额定区间里,冷却回路的流量和温差也很正常,警告栏里也没有任何的异常报警。

    “供能没有问题呀。”

    他又用鼠标点了点小黑点旁边的资料。

    “小黑你饿了,你倒是吃啊。”

    然而小黑点还是没有任何的反应。

    “难道是这些东西太难了?”

    “小黑现在回到初始状态,吃不下了?”

    想到这里,李东又去把义务教育阶段的数学、物理和自然科学这些材料全都下载了下来,然後扔到了对话框里。

    小黑点依然没有反应。

    只是头上再次弹出了【Huny。】

    【小黑,你变了,你开始变挑食了。】

    就在李东吐槽小黑的时候,他的电话响了。

    是姚先生打过来的。

    “喂,姚先生。”

    “李东院士,你的身体无碍了吧?”

    “嗯,已经没事了,谢谢姚先生关心。”

    “没事就好。”

    姚先生轻轻一笑然後说道。

    “今天我给你打电话主要是诺维格教授刚刚和我聊了一件事。”

    随後姚先生就将那三家模型开放自我迭代写回权限的事,以及诺维格在测试中发现异常的情况,都简单的说了一遍。

    李东听着听着,就皱起了眉头。

    “写回权限?”

    “对。”

    “现在我们还无法确定,这是商业目的留下的漏洞,还是在线自我迭代引起的目标误泛化。”

    “可无论是哪一种,都很有可能危及到用户的隐私。”

    李东点了点头。

    模型的自我迭代最危险的地方,从来都不是它会多写几行代码。

    真正危险的是模型提出的改动如果出现偏差不需要经过人工审核,就会被写进下一轮。

    这样,这些偏差也会被保存下来,经过一轮又一轮的强化学习,最终让模型偏离人类的意图。

    这样的偏移可能不会让大模型产生人格意识,可是它依然可以把偏离人类意图的策略变成实际操作,进而误用权限、泄露数据,对用户造成真真实实的危害。

    姚先生说到这里,叹了口气。

    “李院士啊,其实我是有点担心未央。”

    “担心未央?”

    “嗯。”

    要知道,直到现在,未央依旧在综合推理和软件工程等公开的基准上,断层领先其他的任何大模型。

    而外界只知道未央很强,却不知道公开服务器里的未央只开放了完整能力的大约 6成而已。

    姚先生此时接着说道。

    “国外的那些模型就算出现异常,外层的权限系统应该还能拦住他们。”

    “但未央……”

    “它实在太强大了,到现在为止,它没有出现过一次可复现的幻觉。”

    “本来未央的工具使用和常规能力就强於这些模型,现在再加上它连这种能让我们看见的破绽都没有。”

    “如果发生了同样的目标偏移,我们可能连发现都发现不了。”

    听到这里,李东也明白姚先生在担心什麽了,他笑着说道。

    “姚先生,您放心。”

    “未央一直在我们的掌控中。”

    开什麽玩笑?

    未央可是小黑弄出来的,市面上的那些大模型能和它比?

    从底层的架构上就完全不一样好吗?

    而且每一次的能力变化都有小黑盯着,怎麽可能出现同样的情况?

    小黑可以为未央加新的能力,但这些能力都只能以独立模块的方式接入。

    根本就没有办法直接改写只读的基础检查点。

    而且每个模块都要先通过独立的验证,从生成到接入,每一步都会留下带签名的状态转换记录。

    没有李东的确认,未央根本就无法进入公开服务。

    “所以,姚先生,未央他的每一项能力,我们都知道从哪来,也知道到哪里去关,这种情况不会发生在未央身上的。”

    听到李东的话,姚先生的语气明显也放松了一些。

    “有你这句话,我就放心了。”

    “国外模型的事,我会再让人了解情况的。”

    “你身体刚恢复,这件事你就别去管了,先把自己的工作安排好。”

    “好的。”

    随後两人又简单的聊了几句,便挂断了电话。

    李东把手机放下以後,心里还是有些感叹。

    这些国外的公司胆子也太大了吧?

    连自己训练出来的模型究竟形成了什麽样的内部策略都没搞清楚,就敢把写回权限给打开。

    李东忍不住地嘀咕了一句。

    “我敬你们是个爷们。”

    这些公司大概觉,只要外层权限系统还在,模型就永远不可能脱离他们的掌控。

    可李东知道,事情可没有这麽的绝对啊。

    香农曾经在群里说过,自己所在的宇宙走失过一个初级的人工智能。

    是不是小黑,李东无法确定。

    但是如果不是小黑的话,这就好玩了。

    那个跑掉的初级人工智能会不会沿着大模型这条路成长起来的?

    它同样需要喂语料、代码、图像和反馈数据,然後一轮轮训练、一轮轮迭代?

    如果真是这样的话,国外这三套模型再沿着这条路走下去,最外一层的权限恐怕未必能一直困住它们啊。

    想到这里,李东下意识地看向了右下角的小黑点。

    这时候小黑的头顶又弹出了那个单词

    【Huny.】

    李东愣了一下,然後突然反应了过来。

    小黑现在不吃那堆论文和教材,难道是想去嚐嚐这三套大模型平时吃的东西?

    想到这里,李东立刻打开了 PT的测试界面。

    然而,界面刚刚打开,屏幕右下角的小黑点便突然活跃了起来,头顶的单词一个接一个的往外冒。

    【Huny Huny……】

    紧接着,小黑点变成了一根细长的黑线,沿着李东之前为它设置的模型探测通道,一下子就闯进了 PT的接口。

    “哎,等等啊,小黑。”

    李东话还没说完,小黑就已经完全没入了接口,右下角已经看不到任何的小黑点了。

    李东呆呆地看着屏幕,人都有些傻了。

    所以小黑真正想吃的东西。

    该不会是这 3个大模型吧?

    
『加入书签,方便阅读』