Hermes Agent静态演示 · 不接任何 API

音视频转录整理助理「小D」

收到播客/视频/会议录音链接,自动下载、转录、整理成分享式提纯稿 —— 保留案例、数字和原话,不是三句话总结。

典型音频时长
69 分钟
端到端耗时
~10 分钟
工作流判断点
10
交付前检查项
17

看它工作

下面是一段预置回放,示例内容为虚构。页面不连接任何后端,也无法调用真实 Agent。

飞书 · 与小D 的对话

能力边界

写清楚不做什么,和写清楚做什么同样重要。

会做

  • 保留关键案例、数字、判断链、重要原话
  • 修正人名、公司名、术语的识别错误
  • 按话题分段,标题来自真实内容
  • 超过 2 小时自动分段处理

不做

  • 摘要式要点(交付物是提纯稿)
  • 绕过付费墙或访问控制下载
  • 多语言翻译,只做中文整理
  • 编造原文没有的内容

交还人工

  • 非公开内容必须先确认授权
  • 无法核实的专名标 [待确认]
  • 交付前可选择先看大纲
  • 发送失败时提供本地路径

提纯稿不是摘要

同一段内容的两种处理方式。左边是这个 Agent 明确拒绝产出的。

摘要 · 不要

嘉宾讨论了远程协作的若干问题,认为沟通方式需要调整,并分享了一些团队管理经验。

提纯稿 · 要这个

他们把每周会议从 5 场压到 1 场,其余改成异步文档。头两个月效率反而降了三成 —— 因为没人写清楚上下文。真正的转折点是强制要求「任何请求必须自带背景说明」。

差别在哪:摘要压缩信息,提纯稿保留信息密度。具体数字、失败过程、真正起作用的动作,都要留下。

工作流

每个判断点都有明确依据和两条出路,失败情况都有兜底。

  1. 识别来源 —— 小宇宙/B站/YouTube/飞书妙记/本地文件。格式不明确就反问,不猜。
  2. 授权检查 —— 疑似付费课程或私密会议,停下来问,未确认不处理。
  3. 优先找现成字幕 —— 有逐字稿就直接用,跳过语音识别。
  4. 下载与实测时长 —— yt-dlp 取音频,ffprobe 实测时长(不信元数据)。
  5. 转录 —— mlx_whisper--initial-prompt,把节目名、嘉宾、专有名词先喂给模型。
  6. 清洗 —— 去时间戳、说话人标签、口水话,修错词,清除重复幻觉。
  7. 分段与强调 —— 标题必须来自真实内容,禁止「其他有效观点」这类垃圾桶标题。
  8. 交付 —— 存 markdown 文件,发送到对话,附正文预览。发送失败退回纯文本分段发送。
flowchart TD A[收到链接] --> B{格式明确?} B -- 否 --> B1[反问用户] B1 --> A B -- 是 --> D{非公开内容?} D -- 是 --> D1[停下确认授权] D1 --> E D -- 否 --> E{有现成字幕?} E -- 是 --> M[清洗与分段] E -- 否 --> G[下载音频] G --> H{下载成功?} H -- 否 --> H1[报原因并给建议] H -- 是 --> K[转录 + initial-prompt] K --> L{质量正常?} L -- 否 --> L1[标注异常仍交付初稿] L1 --> M L -- 是 --> M M --> R[存 markdown 文件] R --> S{发送成功?} S -- 否 --> S1[退回纯文本分段发送] S -- 是 --> T[附正文预览] classDef m fill:#faeeda,stroke:#ba7517,color:#412402 classDef f fill:#fcebeb,stroke:#a32d2d,color:#501313 class B1,D1,L1 m class H1,S1 f

工程记录

真实约束下的取舍。这部分比功能列表更能说明这个 Agent 是怎么被造出来的。

一、交付形态被迫改过一次

最初设计的交付物是飞书文档链接。实施时发现该租户不开放云文档 OpenAPI —— 四条路径全部试过:

尝试身份结果
创建文档 docx应用身份90003088
创建文档 docx用户身份90003088
上传 markdown 导入用户身份1061004 forbidden
消息通道发送文件应用身份可用

换用户身份依然被拒,说明限制在租户层面,不是权限配置问题。于是交付形态改为「markdown 文件 + 对话内预览」,岗位目标和质量标准不变,只换载体。

二、转录参数是测出来的,不是猜的

180 秒样本,Apple M4:

配置耗时专有名词标点
基准39.5s识别错误
+ initial-prompt26.9s正确
4bit 量化26.0s识别错误
音频 1.75 倍速20.9s错误更多
结论:加提示词反而更快 —— 重复幻觉减少,模型不再空转。而看起来最快的两个方案都被否决:加速音频漏词约三成,量化模型会抵消提示词对专有名词的修正效果,而那恰恰是这个岗位最在意的。