ATT借助开源模型削减向Anthropic支付的费用

ATT借助开源模型削减向Anthropic支付的费用

  ATT副总裁马克・奥斯汀表示,这家电信企业计划通过更多采用英伟达的Nemotron等开源大模型 ,在未来几年将员工调用Anthropic与OpenAI模型产生的支出维持在现有水平 。

ATT借助开源模型削减向Anthropic支付的费用-第1张图片

  奥斯汀负责管理公司10万名员工所使用的人工智能,应用场景覆盖代码编写、财务分析,以及人力资源和 *** 人员使用的各类工具。虽然ATT也向消费者提供部分AI功能 ,例如手机应用内的聊天机器人,但该公司的AI应用绝大部分集中在内部业务。

ATT借助开源模型削减向Anthropic支付的费用-第2张图片

  他称,过去一年 ,ATT扩大了开源模型的使用规模 ,近来 员工发起的AI请求当中,已有40%由开源模型处理 。公司计划未来几年将这一比例提升至60%‑70%。

  奥斯汀表示,他发现开源模型的效果“与Anthropic 、OpenAI等厂商的旧版模型不相上下 ,甚至表现更优”。举例而言,ATT软件开发者处理代码生成这类复杂任务,仍然会选用顶尖闭源模型;但对于代码摘要生成这类算力需求较低的工作 ,则可以使用成本更低的开源模型 。“我们预计开源模型后续还会持续迭代优化 。 ”

  ATT还借助模型路由工具实现成本节约,这类工具会根据任务复杂程度,自动把员工的请求分配给成本更低的模型。奥斯汀介绍 ,公司接入路由服务商Lite LLM之后,代码编写等部分高阶AI任务的成本比较高 下降56%,而AI输出质量仅下滑2%。

  奥斯汀称 ,ATT于2023年推出核心内部AI系统Ask ATT,该系统最初完全依托于通过微软云采购的OpenAI模型 。此后,公司为这套服务接入了更多模型。员工借助该系统完成各类工作:软件开发人员编写、修改代码;普通员工查询公司人力资源制度;销售人员实时记录会议内容、总结 客户通话纪要; *** 人员在和用户沟通时调取借鉴 资料。

  奥斯汀表示 ,使用Ask ATT的软件开发人员可以自主选取 特定模型或者AI智能体 ,包括GitHub Copilot 、Devin、Claude Code、Codex,但相关调用设有费用上限 。

  奥斯汀透露,Ask ATT当前每天 处理450亿token(文本最小处理单元)。奥斯汀并未披露这套系统的实际运行成本;但依据OpenAI 、Anthropic等厂商公开报价 ,如果全部采用闭源模型处理如此巨量的token,每年至少需要数亿美元。

  奥斯汀表示,除Nemotron以外 ,ATT还在使用Meta的Llama 、谷歌Gemma等开源/开放权重模型 。部分模型推理任务部署在自有数据中心内,依托英伟达、AMD服务器芯片运行;相比向云厂商租用算力来跑模型,这种模式往往成本更低。

  奥斯汀称 ,根据ATT的实际使用体验,开源模型的能力通常比前沿闭源模型落后6‑10个月,但两者之间的差距正在不断缩小。

©版权声明
THE END