# 运营商智能体评测：生成质量不忍直视

> 测了三类生成任务（网页/SVG），旗舰模式 6-7 分钟一个页面，效果从'一般般'到'不忍直视'。纯生成质量上打不过本地 27B + 成熟 harness 的组合。

![中国电信 TeleAgent 评测界面示意](/assets/articles/lcz/teleagent/hero.jpg)

> 用标准评测模式测了三类生成任务（网页表达钍基熔盐堆原理、网页表达中国传统八卦、SVG 表达薛定谔的猫），结果：旗舰模式耗时 6-7 分钟，效果"一般般"到"不忍直视"。

## 测试对象

中国电信 TeleAgent 星辰超级智能体 v2.5.3，旗舰模式。

## 三个测试任务

| 任务 | 耗时 | 结果 |
| --- | --- | --- |
| 生成网页表达钍基熔盐堆运行原理 | 约 6 分钟 | 效果一般般 |
| 生成网页表达中国传统八卦文化 | 约 6 分钟 | 明显错误和错位 |
| 生成 SVG 表达薛定谔的猫思想实验 | 约 7 分钟 | 不忍直视 |

## 怎么读这个结果

这不是"能不能用"的问题，是"值不值"的问题：

- **6-7 分钟一个页面**：本地模型跑同类任务（比如 27B 本地 Qwen 写 HTML）通常 1-2 分钟出结果
- **明显错误和错位**：生成式 UI 最核心的价值是"一次出对"，出错率高的话反复重试反而更慢
- **旗舰模式**：这是它最强的档位，连这个档位都这样，日常档只会更差

## 结论

电信这类运营商的"超级智能体"，在**结构化创意生成**（网页/SVG）上目前还打不过本地 27B 模型 + 成熟 harness 的组合。它真正的价值可能在别处（企业接入、合规、语音交互），但纯生成质量上别指望。


---
来源：https://laobanclaw.top/articles/teleagent-benchmark-neg/（AI 军火库）
