找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4163

积分

0

好友

537

主题
发表于 2 小时前 | 查看: 5| 回复: 0

模型越来越多,入口却不一定越来越好用。

7月29日,Agnes AI 正式启用全新国内官网域名:https://agnes-ai.cn/
同一时间,API 访问入口完成换挡,Agnes 2.5 Pro Alpha 杀入 Artificial Analysis 综合能力榜单前列,2.5 Flash 继续不限期免费开放。一场围绕模型能力、开发者入口和多模态落地的抢位战,已经打响。

国内访问入口升级,API 服务同步调整

随着 AI 应用生态不断扩大,模型服务的稳定访问和开发体验成为开发者关注的重要环节。此次 Agnes 国内官网上线,是其进一步完善国内用户服务体系的重要一步。为了配合国内访问入口调整,Agnes 还同步提供了新的 API 服务地址。

原国际站注册用户无需前往国内站重新注册,也无需更换原有 API Key。中国大陆用户如需继续使用原国际站账户及原有 API Key,只需将原接口 Endpoint 从 https://apihub.agnes-ai.com/v1 替换为 https://apihub.agnes-ai.cn/v1 即可。原有的 API Key、模型名称、请求参数和调用方式均无需修改,完成地址替换后,根据运行环境重新启动应用或服务即可。

API 平台访问入口:https://platform.agnes-ai.cn

Artificial Analysis 评测:Agnes 2.5 Pro Alpha 进入综合能力前列

伴随国内官网上线,Agnes 2.5 Pro Alpha 在 Artificial Analysis 上的首轮评测成绩也正式公布。根据公开榜单,模型在综合智能、Coding 和终端任务相关指标表现较为突出。

Agnes 2.5 Pro Alpha 的 Intelligence Index 得分为 39,在 153 个参评模型中排名第 9。该指数综合了真实职业任务、Agent 工具使用、终端 Coding、科学编程、复杂推理和长上下文等多个维度,更接近模型在实际工作环境中的综合表现,而非单一知识问答能力。

Agnes 2.5 Pro Alpha 模型性能分析截图

Coding Index 得分为 58.8,Terminal-Bench v2.1 得分为 67.0%。

Terminal-Bench v2.1 各模型得分对比

榜单链接:https://artificialanalysis.ai/models/agnes-2-5-pro-alpha  

Terminal-Bench v2.1 要求模型进入真实终端环境,执行命令、读取和修改文件,并完成软件工程与系统任务,与当前 AI Coding Agent 的实际使用方式高度接近。

Flash 免费开放,Pro 面向复杂开发场景

跑分之外,Agnes 2.5 系列的定位也更加清晰。

Agnes 2.5 Flash 面向日常 Coding、Agent 和高频开发任务,适合处理文档、生成代码、修复 Bug 和修改项目。更关键的是,Agnes 2.5 Flash 将继续不限期免费开放。这意味着大量日常开发需求可以继续通过 Agnes 的模型完成,而不必先被成本门槛拦住。

而 Agnes 2.5 Pro Alpha 则定位更高复杂度场景。作为 Pro 系列的早期版本,它已具备旗舰模型的核心能力方向,瞄准的是复杂 Agent、专业 Coding 和高难度工程任务。相比 Flash,Pro Alpha 更强调复杂问题的理解与推理、长链路任务执行、大型项目协作,以及复杂代码分析和工程开发。同时,Agnes 2.5 Pro Alpha 支持 1M 超长上下文窗口,可以处理更大规模的代码仓库和业务资料。

两个任务:从互动游戏到单文件网页工具

为了观察 Agnes 2.5 Pro Alpha 在实际开发任务中的表现,我们设置了两个测试。第一个考验的是内容生成和交互组织,第二个测试则更偏具体的算法与工具开发。

任务一:文字剧情互动游戏网页
提示词没有提供完整剧本,也没有详细规定人物、剧情和技术结构,只要求模型参考文字互动游戏的常见玩法,自行设计故事与交互。为了快速验证玩法,人物形象和视频素材暂时只预留位置,优先完成能够运行的游戏原型,后续再逐步补充正式美术资源。在这条相对宽泛的需求下,Agnes 2.5 Pro Alpha 补充了故事主题、人物设定、场景安排、视觉小说界面、属性系统、剧情分支和结局页面,并将这些模块整合成一个可以直接在浏览器中运行的网页原型。

任务二:图片仿色工具 Color Echo
最开始的需求很简单:上传一张参考图和一张待处理图片,通过 LAB 色彩迁移方法,提取参考图的色彩特征并迁移到另一张图片上。整个处理过程都在浏览器本地完成,不需要搭建后端。基础仿色功能跑通后,又分几轮逐步加入了实时参数调节、处理前后滑杆对比、肤色与高光保护、配方保存和高清图片导出等功能。最后,为了让页面更完整,接入了一个自己常用的前端网页生成 Skill,对整体布局和视觉样式进行了统一优化。最终,模型把仿色算法、参数控制、状态保存和图片导出等功能整合进了一个单文件网页中。

这个案例并非一次生成完成,而是在基础功能可用之后,再通过多轮修改逐步补齐细节,也更接近日常产品开发和迭代的真实过程。

调用数据与多模态趋势

根据 Agnes 披露的数据,其全模态模型单周 Token 处理量已经达到 8.16 万亿,其中文本 Token 为 5.10 万亿,占总量的 62.5%;多模态 Token 为 3.06 万亿,占比达到 37.5%。从调用结构来看,文本仍是目前最主要的使用类型,但图像、视频等多模态任务已经贡献了超过三分之一的 Token 处理量,平台的使用场景也在进一步向多模态延伸。

模型之外,Agnes 团队也在持续参与 SGLang 开源社区建设。根据 GitHub 公开记录,团队提交的 4 项 Pull Request 目前均已合并,相关工作涉及多卡并行、显存优化、缓存 Token 统计和 KV Cache 稳定性等方向,主要用于提升大模型推理服务的运行效率和系统可靠性。

随着 Agnes 2.5 Pro Alpha 进入开发者实测阶段,国内用户现在即可通过官网 API 入口 https://agnes-ai.cn/ 进行体验。对于模型部署、开发工具及 AI 应用的深入讨论,欢迎前往云栈社区进行技术交流。

参考资料:
https://artificialanalysis.ai/models/agnes-2-5-pro-alpha
https://agnes-ai.cn/




上一篇:入门新秀露出?AMD Radeon RX 9050 登录华擎官网,Navi 44 核心亮相
下一篇:英特尔LGA1700平台DDR4 vs DDR5游戏性能:15款实测最高差25.3%
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-7-30 02:27 , Processed in 1.060894 second(s), 39 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表