
用标准评测模式测了三类生成任务(网页表达钍基熔盐堆原理、网页表达中国传统八卦、SVG 表达薛定谔的猫),结果:旗舰模式耗时 6-7 分钟,效果"一般般"到"不忍直视"。
测试对象
中国电信 TeleAgent 星辰超级智能体 v2.5.3,旗舰模式。
三个测试任务
| 任务 | 耗时 | 结果 |
|---|---|---|
| 生成网页表达钍基熔盐堆运行原理 | 约 6 分钟 | 效果一般般 |
| 生成网页表达中国传统八卦文化 | 约 6 分钟 | 明显错误和错位 |
| 生成 SVG 表达薛定谔的猫思想实验 | 约 7 分钟 | 不忍直视 |
怎么读这个结果
这不是"能不能用"的问题,是"值不值"的问题:
- 6-7 分钟一个页面:本地模型跑同类任务(比如 27B 本地 Qwen 写 HTML)通常 1-2 分钟出结果
- 明显错误和错位:生成式 UI 最核心的价值是"一次出对",出错率高的话反复重试反而更慢
- 旗舰模式:这是它最强的档位,连这个档位都这样,日常档只会更差
结论
电信这类运营商的"超级智能体",在结构化创意生成(网页/SVG)上目前还打不过本地 27B 模型 + 成熟 harness 的组合。它真正的价值可能在别处(企业接入、合规、语音交互),但纯生成质量上别指望。