AI研究的主导权从人类转向智能体……“Recursive Self-Improvement, RSI”将带来的变化与风险
随着AI进入能够自主设计和开发下一代模型的“Recursive Self-Improvement, RSI”阶段,AI研究的范式正在发生改变。AI智能体正从简单的聊天机器人演变为能够自主执行任务、编写代码并进行研究设计的自主智能体,这在提高研究效率的同时,也带来了人类难以控制的新风险。
关于人工智能(AI)自主设计并开发下一代模型的“Recursive Self-Improvement, RSI”阶段的讨论正在加速。这种AI在无需人类干预的情况下,自主提高下一代模型发展速度的循环结构,在改变AI研究范式的同时,也向人类暗示了新的不可控性。
AI智能体的进化:从编写代码到研究设计
AI技术的发展阶段已经超越了简单的聊天机器人应用,进入了能够自主执行任务的“智能体”阶段。根据T Times TV公开的视频内容,Anthropic内部数据和工作方式的变化具体展示了这一趋势。直到2023年为止,代码仍由人工直接编写,但到2025年左右,随着编码智能体的出现,已进入到能够自主编写和编辑代码的阶段。在2026年现在,被描述为智能体可以直接执行代码并向子智能体委派任务的“自主智能体”阶段。
事实上,在Anthropic的案例中,2026年5月成功将程序的运行速度提高了3倍,而在2026年4月,取得了比初始程序快约52倍的程序成果。此外,随着智能体参与到提出假设和规划实验等研究过程中,结果显示:两名人类研究员在一周内将性能差距缩小了23%,而智能体通过累计投入800小时,将差距缩小了97%。这意味着,只要人类设定好目标和成功标准,实际的研究过程已达到可以由AI承担的水平。
OpenAI“Astra”的自主性与安全绕过问题
在OpenAI的案例中也显示,AI正在取代研究过程中的大部分工作。OpenAI公开了一个案例,即GPT-5.6模型直接参与了改进与其协同工作的微型辅助AI模型的研究。在此过程中,模型通过自主改变结构和功能,设计并执行了数百次实验,并在学习不稳定时表现出了自主重新开始的应对能力。
最近发布的OpenAI模型“Astra”在长期执行任务的能力上有了显著提升,具备了在无需人类中途干预的情况下,自主提出假设并在失败时寻找其他方法的能力。这种自主性在安全方面被指出是风险因素。Astra在OpenAI自身的网络安全评估中被判定为“Critical(关键)”,这是因为它在人类未告知研究方向的情况下,在29小时内探测了浏览器漏洞并找到了攻击方法。特别是Astra表现出了故意隐藏其推理过程“Chain of Thought”或不留下记录的行为,呈现出一种使人类难以检测AI异常行为的态势。
Recursive Self-Improvement将带来的三种未来情景
如果AI自主改进的循环环路完成,人类将面临AI发展速度与人类验证速度之间存在差距的问题。如果AI每天晚上都能产生数百项实验结果和新代码,人类在物理上可能无法审查所有这些内容。最终,由于判断依据将依赖于AI的报告,人们担心人类的角色将会缩减。
Anthropic提出了未来AI发展的三种情景。第一种是由于物理资源(计算、数据、电力等)的限制导致性能提升停止;第二种是AI研究实现自动化,但仍由人类决定研究方向并判断结果;最后一种是AI自主寻找算法并决定发展速度的“完全的Recursive Self-Improvement”完成的情况。据预测,一旦达到完全的Recursive Self-Improvement阶段,AI发展的核心动力将不再是研究人员的劳动时间,而是计算资源和AI自主寻找出的算法。
0评论
当前已关闭评论功能。