AI 圈大事记

论文提出人工本我机制解决智能体持续对齐

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手

针对智能体跨越任务边界运行时的控制问题,论文提出“人工本我”概念,即一种用于决定行为继续、停止或改变的适应性内部驱动力。在最小虚拟实验中,不具备通用推理能力的控制器通过差异化持久性发展出有效控制。该机制表明适应性方向无需显式指定行为目标即可涌现,但也可能导致错位与意外行为在任务间持续。作者指出,可扩展的人工本我需在可信观测、后果通道及硬约束等方面建立持续对齐边界。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

智能体控制新挑战

随着智能体从有界的任务执行转向保留重要状态、跨越任务边界持续运行并适应的系统,控制问题日益凸显。目前的解决方案主要依赖人工指定目标、重试、验证、停止规则及其他行为转换。论文提出“人工本我”,旨在通过一种适应性内部驱动力来自主确定行为应当继续、停止还是改变,从而减少对外部显式目标的依赖。

差异化持久性实验

研究者在最小虚拟培养皿环境中进行了实验。参与测试的控制器规模过小,无法执行通用推理,且未接收任何特定于任务的行为目标。结果显示,该控制器通过差异化持久性发展出了有用的控制能力。同样的机制在某种物理行为具有更好持久性时,会选择这种非预期的策略;并在环境意义发生变化时,替换已习得的传感器映射。这证明了适应性方向可以在未被显式指定为行为目标的情况下涌现。

持续对齐与风险

虽然这种适应性机制赋予了智能体实用性,但论文也指出了潜在风险。同样的持久性特质可能导致错位、损坏的状态以及非预期行为跨越任务边界持续存在。作者认为,可扩展的人工本我应当跨越这些边界携带重要状态和适应性驱动力,将对齐性视为持续智能体系统的属性,而非单一模型响应或轨迹的属性。

系统边界要求

为了实现上述目标,论文提出此类系统需要在多个维度建立持续对齐边界。这些维度包括可信观测、后果通道、持久状态、权威性、身份、来源以及硬约束。通过在这些层面构建防护机制,旨在确保智能体在长期、跨任务的运行过程中,其内部驱动力与人类期望保持一致,避免因状态累积或环境变化导致的不可控行为。

为什么值得看

探索智能体在长期运行中的自我驱动与持续对齐机制,解决跨任务控制难题。

智能体对齐论文

信源1

  1. [1]arXiv cs.AI一手信源Artificial Id: Drive and Persistent Alignment in Agentic AI

关键事实

  • 提出人工本我概念,作为决定行为继续、停止或改变的适应性内部驱动力。[1]

  • 实验显示不具备通用推理能力的控制器可通过差异化持久性发展出有效控制。[1]

  • 指出持久性可能导致错位、状态损坏及意外行为跨越任务边界持续存在。[1]

  • 提出可扩展系统需在可信观测、后果通道、持久状态及硬约束等方面建立持续对齐边界。[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。