Skill 参考库 · 沟通与协作 · Skill 解读 · WF-053

沟通与协作参考:AI Powered Meeting Summarizer

思行致远 · 2026/6/30 · 置信度:中
会议纪要行动项协作沟通

一个 Gradio 音频上传应用,用 whisper.cpp 本地转写会议录音,再通过 Ollama 本地模型生成摘要。

AI Powered Meeting Summarizer

一个 Gradio 音频上传应用,用 whisper.cpp 本地转写会议录音,再通过 Ollama 本地模型生成摘要。

这个能力解决什么问题

它解决的是不想把音频和文本发到云端时的会议摘要需求。用户上传 .wav/.mp3 等音频,可选会议上下文、Whisper 模型和 Ollama 总结模型;系统输出摘要,并提供完整 transcript 下载。

核心逻辑

启动脚本会创建 Python 环境、检查 FFmpeg、克隆并构建 whisper.cpp、下载默认 Whisper 模型,然后启动 Gradio。运行时先把音频转为 whisper.cpp 可处理格式,执行本地 ASR;随后调用正在运行的 Ollama server,用选定模型对 transcript 做摘要。

技术结构

  • 关键模块:run_meeting_summarizer.sh 管环境、whisper.cpp 构建和模型下载;main.py 管 Gradio UI、音频处理、Ollama 请求。
  • 调用链路:音频上传 -> FFmpeg/whisper.cpp -> transcript -> Ollama summarization -> summary + transcript download。
  • 输入输出:输入是音频文件和可选上下文;输出是摘要和转写文本。
  • 核心依赖:Python、FFmpeg、whisper.cpp、Ollama、Gradio、requests。

为什么值得参考

它的价值在本地优先:ASR 和总结都能跑在自己的机器或服务器上,隐私边界比云端 Whisper + 云端 LLM 更清楚。模型选择下拉也把“转写模型”和“总结模型”分开,便于按性能和质量调整。

为什么不建议直接套用

它仍然处理会议录音,授权和留存必须先定义。whisper.cpp 和 Ollama 的安装成本不低,不适合非技术用户直接维护。README 中翻译参数示例表述有混淆,语言检测/翻译行为需要实测。没有用户隔离、审计日志或企业权限系统。

如何改造成自己的版本

把它改成“本地会议资料处理台”:只接受用户主动上传的已授权录音,默认处理后删除临时音频。增加 speaker/时间戳、action items 和人工确认状态。对中文场景单独测试 Whisper 模型和 Ollama 中文摘要质量,不要默认相信英文 meeting prompt。

适用场景

  • 本地或内网运行的会议转写摘要。
  • 对隐私敏感、不想调用云 ASR 的团队。
  • 研究 whisper.cpp + Ollama 的离线工作流。

不适用场景

  • 未授权会议录音。
  • 要求多人账号、权限、审计的企业产品。
  • 低配置电脑上处理长音频。

公开版边界

  • 录音和转写须获得参会者知情同意。

参考信息

  • 原项目:AI-Powered-Meeting-Summarizer
  • 作者:AlexisBalayre
  • 相关概念:[[本地转写]]、[[会议摘要]]
  • 相关卡片:保守留空

参考对象信息

名称:AI-Powered-Meeting-Summarizer

作者:AlexisBalayre

链接:https://github.com/AlexisBalayre/AI-Powered-Meeting-Summarizer

适用场景与行动

场景:Skill 参考库 / 沟通与协作

适合谁:关注 AI 工作流、Skill 生产和 Agent Building 的读者

下一步:先阅读边界说明,再判断它是否适合改造成自己的沟通与协作流程。

当前内容按公开来源和已审核草稿整理,只作为工作流理解与方法论参考。

涉及客户数据、外部平台、会议记录和业务系统的场景,必须保留人工确认与授权边界。