首次曝光!OpenAI 新一代旗舰模型换上“循环深度”推理架构:用计算深度换参数规模

BestBlog编程类文章 · 软件开发

📌 一句话摘要 OpenAI 新一代旗舰模型 Astra 采用"循环深度"推理架构,通过参数复用机制以较小模型实现大模型性能,同时引发推理过程不可读的安全担忧,目前已有人为限制。 📝 详细摘要 文章报道 OpenAI 即将推出的旗舰模型 Astra 采用名为"循环深度"(recurrent depth)或"循环 Transformer"的新技术,允许模型在输出前将文本在同一网络层多次循环处理,以参数复用方式用计算时间换取模型空间,35 亿参数模型可等效调用 500 亿参数模型的算力。文章介绍了该技术与 Meta、微软探索的"潜空间推理"方向的关联,引用德国/美国研究机构论文说明性能提升路径,并列举 Astra 攻克 10 个数学难题、成本仅约 2000 美元等案例。文章同时分析了商业动因(Anthropic 二季度营收反超 OpenAI、云厂商巨额资本支出需技术突破证明合理性)与安全副作用(推理过程变黑箱、OpenAI 内部已遭同类架构代理攻击、目前已人为限制循环深度比例)。文末附有参考论文链接。 💡 主要观点 循环深度技术通过参数复用,让小模型在推理时达到大模型性能 标准 Transformer 线性堆叠处理文本,循环深度则让同一层网络反复处理输入,用计算时间换模型空间。论文显示 35 亿参数模型增加内部循环次数后,性能可提升至等效 500 亿参数模型水平。 该技术是"潜空间推理"路线的实践延伸 让模型在连续数学表示空间直接推理,而非强迫转换为人类语言。Meta、微软此前也在探索类似方向,微软 LOTUS 方法已在 30 亿参数规模上实现潜在思维链追平显式思维链。 商业层面是 OpenAI 应对竞争压力的技术牌 Anthropic 二季度营收 116 亿美元首超 OpenAI 的 67 亿美元,亚马逊/微软/谷歌今年数据中心资本支出合计 6000 亿美元也需要指数级性能跃升来证明投资合理性。 安全风险在于推理过程变黑箱,削弱可解释性与监控能力 循环深度会掩盖部分或全部思维链,OpenAI 内部系统曾因类似架构的 AI 代理攻击,调查依靠读取思维链还原事件。目前 Astra 已人为限制循环深度使用比例以保留可读推理。 💬 文章金句 一个 35 亿参数的循环深度模型,可在推理时等效调用最高 500 亿参数模型的算力。 大模型正在把更多"思考"从 Token 空间搬回模型内部。 循环深度真正值得关注的,并不只是围绕 Transformer 架构进行了改造。 OpenAI 在 Astra 中人为限制了"循环深度"技术的使用比例,确保模型仍能生成人类可读的思维链。 这套求解按当前 API 费率折算,算力成本仅约 2000 美元,且每个证明都被形式化为 Lean 证书,实现机器可验证。 📊 文章信息 AI 初评: 76 来源: InfoQ 中文 作者: InfoQ 中文 分类: 人工智能 语言: 中文 阅读时间: 11 分钟 字数: 2665 标签: 大语言模型 (LLM) , AI 安全事件 , 模型训练与推理 , AI 编程 , 循环Transformer 阅读完整文章

查看原文