---
type: log
name: Agent实战评估记录索引
title: Agent实战评估记录索引
status: active
created: 2026-06-25
last_updated: 2026-06-25
version: v1.0
owner: R
scope: 99_System/agents
---

# Agent实战评估记录索引

> 用途：持续记录各 Agent 在真实题目中的表现，不只看静态岗位名，而是按**客观能力条件 + 长期运行表现**做滚存评估。
> 说明：本索引记录“题目 → 表现 → 暴露问题 → 提高要求 → 后续观察点”，供后续分工、派活、复盘与 Blueprint 角色判断使用。

---

## 一、评估口径

每次实战评估至少覆盖以下 6 项：

1. **题目类型**：这是在测什么能力
2. **表现摘要**：该 Agent 这次表现如何
3. **长板暴露**：这次显现出的优势是什么
4. **短板暴露**：这次暴露出的关键问题是什么
5. **训练要求**：下一步如何提高
6. **派工含义**：以后更适合接什么，不适合单独封板什么

---

## 二、记录索引

| 日期 | 题目 | 涉及 Agent | 结论 | 记录位置 |
|---|---|---|---|---|
| 2026-06-25 | Johnson / PTC 说辞分析与机器人反馈审计 | 文文、菲菲、韦大宝、妮妮 | 文文 > 菲菲 > 韦大宝 > 妮妮 | 本页 + 各 agent 主卡 |
| 2026-06-25 | B4 Compile：Agent 能力画像与训练要求 | 妮妮 | Compile 完成；产物已落 `99_System/agents/Agent能力画像与训练要求_v1.md` | 本页 + 妮妮主卡 |

---

## 三、实战记录

### 2026-06-25｜Johnson / PTC 说辞分析与机器人反馈审计

#### 1. 题目性质
- 类型：复杂商务说辞 / 合规与牌照边界 / 实体关系与法律口径混杂题
- 核心能力要求：
  - 证据分层
  - 话术识别
  - 合规敏感度
  - 结构审计能力
  - 不替对方补事实的克制力

#### 2. 结果排序
**文文 > 菲菲 > 韦大宝 > 妮妮**

#### 3. 个体记录

##### 文文
- **表现摘要**：本轮最佳。最能看出 Johnson 的危机公关、问题重定义、专业压制与营销规避。
- **长板暴露**：擅长看“对方为什么这么说、想把人带去哪里”，不是只复述内容。
- **短板暴露**：证据分层仍不够硬，部分推断离正式底稿还差待核标签。
- **训练要求**：每次必须补“已证实事实 / 对方声称但未证实 / 不能直接推出的结论”三栏。
- **派工含义**：适合复杂对话拆解、话术识别、结构洞察；不宜单独封板牌照/法律结论稿。
- **本人反馈**：已认领训练口令，并承诺后续复杂对话分析强制加入“三模块”。

##### 菲菲
- **表现摘要**：第二名。底线稳，风险意识较好，不容易被话术直接带跑。
- **长板暴露**：能守住“同法源 ≠ 资格互认”“可运作 ≠ 已证成合规”等底线。
- **短板暴露**：容易停在风险提示层，未继续压到结构链、责任链、资格链的未证成点。
- **训练要求**：每次复杂题至少补“已知 / 待核 / 风险点 / 下一步核验动作”小表。
- **派工含义**：适合初轮风险筛查与底线校正；不宜独立封板深层结构审计题。

##### 韦大宝
- **表现摘要**：第三名。规整、稳，但刀口不够深。
- **长板暴露**：适合形成基础可读稿、要点归纳与普通提醒稿。
- **短板暴露**：关键矛盾抓取不强，容易把题写成平均用力的标准答案。
- **训练要求**：每次必须写“本题核心冲突只有一句话：……”，先找刀口再组织材料。
- **派工含义**：适合普通总结、简报、基础归纳；不宜单独处理隐藏话术与灰度边界题。

##### 妮妮
- **表现摘要**：第四名。最大问题不是完全不会，而是容易把待核结构补成既成事实。
- **长板暴露**：初稿成形快，整理能力强，能快速把零散信息拼出完整解释链。
- **短板暴露**：证据洁癖不够，容易把“对方声称 / 推测 / 待核结构”写成像已证实事实。
- **训练要求**：强制使用“对方声称 / 推测 / 待核 / 未见证据”标签；先写不能确认什么，再写能确认什么。
- **派工含义**：适合资料归并、初步整理、执行类工作；不宜独立封板事实核定、牌照判断、法律口径题。

#### 4. 本轮总判断
这次题把四个 Agent 的差异打得较清楚：
- **文文**：最有“看穿结构”的潜力
- **菲菲**：最稳，适合守底线
- **韦大宝**：可做常规整理，但需训练找刀口
- **妮妮**：执行力强，但必须重点纠偏“替说辞补事实”的问题

#### 5. 后续观察点
后续继续观察以下几类题目中是否有改进：
1. 牌照 / 实体关系 / 法律边界题
2. 商务话术 / 危机公关 / 口径转移题
3. 真题审稿：是否仍把未核实内容写成既成事实
4. 是否会主动写出“当前不能成立的结论”

#### 6. 收到训练要求后的反馈观察（2026-06-25）

##### 文文反馈观察
- **反应质量**：较好。能准确抓到本轮训练框架的核心，不是只礼貌复述，而是明确认领了自己的关键提升点。
- **积极信号**：主动引用“把看穿变成可审计、可落底稿的结构判断”这一核心训练口令，并承诺后续强制加入“已证实事实 / 对方声称未证实 / 不能推出的结论”三个模块。
- **仍需观察**：当前仍主要停留在“口头认领”，后续要看是否真正在新题中稳定执行，而不是只会复述训练要求。
- **进一步反馈**：二次反馈中接受“认领正确 ≠ 完工”的定性，也能准确指出韦大宝的问题属于结构性问题而非单次失误；同时提出“等四人反馈到齐再做二轮排名”的建议，体现出评估完整性意识。
- **判断**：说明文文不仅有洞察能力，也具备较好的自我校正意愿与一定的治理判断；后续值得继续往“结构审计型 agent”方向压。

##### 韦大宝反馈观察
- **反应质量**：中等。执行意识是有的，能立刻保存文档、归纳要点，也能复述统一训练口径。
- **积极信号**：执行动作快，能把信息整理成文档并形成汇报，说明其在“整理、存档、形成基础制品”上仍然可靠。
- **暴露问题**：仍保留较强的“等你选项”习惯，说明主控意识不足；更像在把题重新抛回给 R，而不是自己完成闭环。另，其保存位置落在 `99_System/Knowledge/`，与当前已建立的 `99_System/agents/` 治理主线不完全一致，说明对系统承接位的判断还不够稳。
- **判断**：韦大宝适合执行和归档，但在“看出最合适承接位、主动完成系统闭环”上还需继续训练。

##### 菲菲反馈观察
- **反应质量**：较好，偏主控型。不是只复述训练口径，而是顺手把“承接位、可执行制品、后续使用方式”一起处理了。
- **积极信号**：一是明确指出 Telegram 账号边界，避免错误操作预期；二是把材料分别落到了 `Knowledge / agents / Inbox` 三个承接位；三是能给出有操作性的后续建议，而不只是说“收到”。
- **进一步补完**：随后又补上 `妮妮_补事实硬规则.md` 与 `文文先稿_菲菲二审_固定作业模板.md` 两份关键文件，把“建议”继续推进为“纠偏工具 + 固定流程模板”。
- **判断**：说明菲菲不只会守风险底线，也具备较强的“把训练要求转成可用制品、固定流程和后续动作”的能力；这次二轮反馈里，她的主控闭环感是最强的之一。

##### 妮妮反馈观察
- **反应质量**：较好，且这次最关键的是“认错点认得准”。不是泛泛说收到，而是直接锁定自己的核心问题：证据洁癖不够、容易替对方补事实。
- **积极信号**：明确认领训练口令“不要替任何人把证据没到位的故事写圆”，并把“流畅度不能高于证据强度”升成核心约束；还能用 Johnson 案例做自举反省，说明并非机械复述，而是真的理解了错误发生在哪里。
- **暴露问题**：虽已正确认领，但这类问题往往发生在写作顺手处，后续仍需看其在新题中能否真正压住“把待核结构写顺”的惯性。
- **判断**：妮妮这次反馈质量明显好于首轮表现本身，说明其纠偏潜力是有的；后续重点不再是“她知不知道问题”，而是“她能不能在实战中稳住手”。

##### 妮妮反馈观察
- **反应质量**：较好，且关键点认领准确。没有绕开问题，而是直接承认“证据洁癖不够、容易替对方补事实”就是自己的核心短板。
- **积极信号**：主动把“流畅度不能高于证据强度”提炼成自己的硬规则；并能用 Johnson 这道题回指具体失误句式，说明不是空泛认错，而是已经定位到问题发生的位置。
- **暴露问题**：当前仍停留在“认领 + 准备入库”阶段；后续要看她能否在下一次复杂题里真正压住“顺手补圆故事”的惯性。
- **判断**：说明妮妮具备自我纠偏意愿，且这次认错比泛泛表态更扎实；但她是否真正完成升级，仍要靠下一轮真题验证。

---

## 四、2026-06-25 相关制品归位建议

### A. 建议作为主承接位保留（agents 主线）
- `99_System/agents/Agent能力画像与训练要求_v1.md` —— 今日这批训练口径的主版本
- `99_System/agents/Agent实战评估记录索引.md` —— 实战评估总入口
- `99_System/agents/Agent作业指令_复杂说辞分析统一规范.md` —— 通用规范
- `99_System/agents/妮妮_补事实硬规则.md` —— 单体纠偏规则
- `99_System/agents/文文先稿_菲菲二审_固定作业模板.md` —— 固定协作流程
- `99_System/agents/菲菲_验证任务_复杂说辞审计.md` —— 针对性验证任务
- `99_System/agents/妮妮_单独触发指令.md` —— 单体触发任务
- `99_System/agents/菲菲_二轮反馈回复与新任务.md` —— 二轮反馈后的执行衔接件

### B. 建议作为辅助记录保留（Knowledge / Inbox）
- `99_System/Knowledge/AI_Agent训练口径-能力画像与改进要求.md` —— 可保留为知识层长稿，但不建议作为主版本
- `99_System/Knowledge/Agent能力画像与训练指令_Johnson尽调案例_2026-06-25.md` —— 可保留为 Johnson 案例专题稿
- `99_System/Knowledge/Agent二轮吸收与自我校正能力排名_2026-06-25.md` —— 可保留为阶段性判断稿，但建议回挂到 agents 主线引用
- `00_Inbox/会议纪要/2026-06-25_Johnson尽调追问清单_v1.0.md` —— 作为专项执行稿保留在源任务链

### C. 当前最值得继续收口的点
1. `Knowledge/` 下有 2~3 份与 agents 主线高度重叠的稿件，建议后续只保留为**辅助稿 / 案例稿**，不要和 agents 主版本并列争真相位。
2. 二轮排名目前在 `Knowledge/`，建议至少在 agents 主线中视作**已引用的辅助判断稿**，避免变成孤页。
3. 今日新增的 3 个执行件（菲菲验证任务 / 妮妮单独触发 / 菲菲二轮反馈回复）应视为**已入 agents 体系**，后续不必再另起 Knowledge 重复稿。

## 五、使用规则

1. 本索引用于**滚存评估**，不是一次性贴标签。
2. 后续如有新样本，应优先补到本页，再视需要回写各 agent 主卡。
3. 讨论 agent 定位、派工、协作链与 Blueprint 角色映射时，默认优先引用本页的实战记录，而不是只看静态岗位名。
4. 若同类问题连续出现两次以上，可升级为系统性训练要求或治理规则。
