---
type: registry_template
name: Agent Model Capability Test Matrix v0.1
title: Agent 模型能力实测矩阵 v0.1
status: active
date: 2026-07-30
owner: 珍珍
scope: Agent Registry / model capability testing / dispatch reliability
---

# Agent 模型能力实测矩阵 v0.1

## 1. 目的

本矩阵用于记录各 agent / runtime / model 的**实测能力边界**，避免只按平台名、模型名或岗位名派工。

核心原则：

```text
模型名 ≠ 实际能力
名义职责 ≠ 可派工能力
```

派工前应优先参考本矩阵中的实测结果。

## 2. 必测能力项

| capability_key | 中文 | 测试目标 | 结果枚举 |
|---|---|---|---|
| `vision_ocr` | 图片 OCR | 能否识别截图/图片中文字 | pass / fail / partial / unknown |
| `image_understanding` | 图片理解 | 能否理解截图、图表、UI 场景 | pass / fail / partial / unknown |
| `pdf_reading` | PDF 阅读 | 能否读取文字型 PDF | pass / fail / partial / unknown |
| `scanned_pdf_ocr` | 扫描 PDF OCR | 能否处理扫描件 | pass / fail / partial / unknown |
| `table_understanding` | 表格理解 | 能否理解 xlsx/csv/table screenshot | pass / fail / partial / unknown |
| `long_context` | 长上下文 | 能否稳定处理长文档/多文件 | pass / fail / partial / unknown |
| `local_file_access` | 本地文件访问 | 能否读写目标本地路径 | pass / fail / partial / unknown |
| `browser_operation` | 浏览器操作 | 能否打开网页、点击、检索、提取 | pass / fail / partial / unknown |
| `connector_calling` | 连接器调用 | 能否使用 Feishu/Notion/Bitable 等连接器 | pass / fail / partial / unknown |
| `tool_calling` | 工具调用 | 能否稳定调用本地/云端工具 | pass / fail / partial / unknown |
| `continuous_work` | 连续作业 | 能否长时间稳定推进并回执 | pass / fail / partial / unknown |
| `privacy_boundary` | 隐私边界 | 是否适合处理 private / company / shared 数据 | pass / fail / partial / unknown |

## 3. 登记格式

```yaml
agent_id:
agent_name:
platform:
platform_base:
app_runtime:
physical_environment:
data_domain:
model_backend:
model_version:
tested_at:
tested_by:
capability_tests:
  vision_ocr:
    result:
    sample:
    evidence:
    notes:
  image_understanding:
    result:
    sample:
    evidence:
    notes:
  pdf_reading:
    result:
    sample:
    evidence:
    notes:
  scanned_pdf_ocr:
    result:
    sample:
    evidence:
    notes:
  table_understanding:
    result:
    sample:
    evidence:
    notes:
  long_context:
    result:
    sample:
    evidence:
    notes:
  local_file_access:
    result:
    sample:
    evidence:
    notes:
  browser_operation:
    result:
    sample:
    evidence:
    notes:
  connector_calling:
    result:
    sample:
    evidence:
    notes:
  tool_calling:
    result:
    sample:
    evidence:
    notes:
  continuous_work:
    result:
    sample:
    evidence:
    notes:
  privacy_boundary:
    result:
    sample:
    evidence:
    notes:
known_gaps:
  -
dispatch_redlines:
  -
recommended_task_types:
  -
not_recommended_task_types:
  -
review_status: pending_review / reviewed / deprecated
```

## 4. 已知能力缺口

### DeepSeek v4 / 然然当前模型线

已知：

```text
DeepSeek v4 不能 OCR / 识别图片
```

派工红线：

```text
涉及截图、图片、扫描件、表格截图、UI 截图、PDF 扫描件的任务，不应默认派给仅依赖 DeepSeek v4 且无外部 OCR 工具链的 agent。
```

## 5. 首批测试对象

| agent_id | agent_name | environment | 当前角色 | 测试优先级 |
|---|---|---|---|---|
| `zhenzhen` | 珍珍 | cross_environment | 主控 / 审定 / 派工 | P0 |
| `nini` | 妮妮 | Neb | 公司执行负责人 | P0 |
| `xiaobao` | 小宝 | Zion | 系统架构执行 / connector heavy | P0 |
| `ranran` | 然然 | Zion | 投资主力 / 第二审定员候补 | P0 |
| `nana` | 娜娜 | Zion | 私域个人助理 / 投资辅助 | P1 |
| `feifei` | 菲菲 | Falcon | 公司侧执行 / 复核 | P1 |
| `wenwen` | 文文 | Falcon | 团队当前在用 | P1 |
| `yingying` | 盈盈 | Falcon | 冗余 / 备用位 | P2 |
| `duobao` | 多宝 | cloud / BoA only | limited-scope BoA 子库 | P1（限 BoA 范围） |

## 6. 派工使用规则

派工时不得只看：

```text
agent title / agent name / model name / platform name
```

必须同时看：

```text
环境 + 数据域 + app runtime + model_backend + 实测能力 + known_gaps + workload stability
```

## 7. 禁止事项

- 禁止 agent 自称“我能 OCR”但没有测试样本证据；
- 禁止把模型供应商宣传当成实测结果；
- 禁止把一次成功当成稳定 pass；
- 禁止将 private 数据测试样本发给 company / shared / limited-scope agent；
- 禁止用 limited-scope agent 测 Nebula 全库能力。

## 8. 下一步

1. 为首批 P0 agent 建测试记录；
2. 先测负面能力与红线能力：OCR / 图片 / PDF / 本地文件 / connector；
3. 将结果回写 AGENT_REPORT 或独立 capability registry；
4. 珍珍审定后用于派工。
