长任务能力被视为衡量AI水平的关键标准。这一观点基于一个基本事实:短任务依赖记忆完成,而长任务则需要深入理解。短任务中,模型仅需处理当前输入;长任务中,模型则需保持上下文连贯性,记住初始意图,并在遇到异常时调整策略。
学术界数据显示,顶级AI在长任务中的通过率不足20%,且代码质量随任务迭代而下降。这并非简单增加参数量可解决,而是需重新思考AI架构,涉及上下文管理、工作流编排、多智能体协作等系统性工程。
在AI编程领域,Claude和Codex代表了两种不同的演进路径。Claude侧重增强上下文容量与协作能力,Codex则强化超人类调试与自我进化。这两条路径并非互斥,能攻克长任务的AI可能需融合两者优势。
Token经济学的兴起为长任务提供了商业价值的锚点。当AI能完成人类需数小时至数天的复杂任务时,百万级Token的成本便变得微不足道。关键在于如何提升AI的完成率,保持代码质量的迭代稳定性,并在不确定性中保持性能。
从短任务到长任务的演进,标志着AI正从“回答问题者”转变为“任务执行者”。过去两年,大模型竞争的焦点一直是模型能力本身,如参数规模、推理深度等。但当AI角色转变为执行者后,游戏规则变了。复杂任务需要理解需求、拆解任务、调用工具等数个甚至数十个步骤。
LongCLI-Bench评估了AI在真实开发场景中的长任务能力,结果令人警醒:即使是最先进的AI,通过率也低于20%。大部分任务在完成度不足30%时便停滞。SlopCodeBench研究揭示了AI在迭代任务中表现的系统性退化模式:随着迭代次数增加,AI生成的代码质量持续下降。
Claude和Codex展现了通往长任务的两条路径。Claude通过增强上下文容量与团队协作能力来应对复杂任务,而Codex则通过超人类调试与自我进化来解决问题。这两种路径的本质区别在于上下文容量和质量。长任务能力的公式可概括为:长任务能力 = 上下文容量 × 上下文质量。
Token的角色从技术副产品转变为AI时代的“新大宗商品”。Token消耗与任务长度呈正相关,且Token的价值密度随任务长度增加。这意味着,长任务不仅体现了AI能完成什么,还体现在它消耗多少Token及这些Token的定价权。AI对SaaS赛道的冲击在于其对按坐席收费模式的结构性瓦解。行业终局愿景是按业务价值或结果付费,但这面临价值归因的难题。
当前,长任务能力的探索已不仅是技术指标的角逐,而是决定AI能否从“玩具”蜕变为“工具”的关键。围绕上下文容量与质量、多智能体协作、纵深防御的编排系统以及Token经济学的创新,正描绘着AI从“回答问题”到“完成任务”的宏大图景。这场变革将重塑我们与数字世界的互动方式,以及商业价值创造的底层逻辑。

发表回复