modelscope.cn

bilibili-summary

分析B站视频,自动下载视频、提取?

Installation

$ npx skills add https://modelscope.cn

Also in this package

Other skills from modelscope.cn · top by installs.

npx skills add https://modelscope.cn

Browse all from modelscope.cn

More details

Agent compatibility

Declared targets from SKILL.md / docs. Unmarked agents are not listed — the skill may still install via the CLI.

Claude Code Not declared
Cursor Not declared
Codex Not declared
GitHub Copilot Not declared
Windsurf Not declared
Gemini CLI Not declared
Cline Not declared
OpenCode Not declared

Skill metadata

Parsed from SKILL.md frontmatter.

Version1.0.0

Package contents

Files included with this skill beyond the listing page.

  • skill md SKILL.md 3,166 B

History

  1. First recorded snapshot · 0 installs

SKILL.md

B站视频总结 Skill

简介

自动分析 B 站视频,通过画面识别 + 语音转录完整还原视频内容,生成结构化 Markdown 总结报告。

适用场景

  • 教程/科普类视频 → 提取知识点和操作步骤
  • Vlog/记录类视频 → 还原时间线和内容
  • 评测/介绍类视频 → 整理参数和对比信息
  • 任何你想"看"但没时间看的 B 站视频

工作流程

B站视频(BV号)
  → 下载视频 + 音频
  → 每18秒提取一帧图片 + 相似度去重
  → GLM-4.6V-Flash(免费) 逐帧识别画面内容
  → Whisper tiny 转录音频为文字
  → AI 综合画面 + 音频 → 生成总结报告

依赖

工具 用途 安装
you-get / yt-dlp 视频下载 pip install you-get yt-dlp
opencv-python 视频拆帧 pip install opencv-python
openai-whisper 语音转录 pip install openai-whisper
ffmpeg 音频解码 系统安装(Whisper 依赖)
openai API 调用 pip install openai

配置

环境变量

# 视觉模型 API Key(至少配一个)
export GLM_API_KEY="your_glm_key"         # 智谱 GLM-4.6V-Flash(免费,推荐)
export DASHSCOPE_API_KEY="your_qwen_key"  # 千问 qwen-vl-max(付费兜底)

# B站 Cookie(可选,用于下载高清视频)
# 从浏览器提取 SESSDATA + bili_jct,写入 cookies.txt

cookies.txt(可选)

# Netscape HTTP Cookie Format
.bilibili.com  TRUE  /  FALSE  0  SESSDATA  your_sessdata_value
.bilibili.com  TRUE  /  FALSE  0  bili_jct   your_bili_jct_value

使用方式

命令行

# 分析视频
python scripts/pipeline.py BV1DoTx6yEev -o ./output

# 跳过下载(已下载过)
python scripts/pipeline.py BV1DoTx6yEev -o ./output --skip-download

# 使用千问作为视觉模型
python scripts/pipeline.py BV1DoTx6yEev --vision-provider qwen

在 AI Agent 中使用

请用 bilibili-summary 分析这个视频:BV1DoTx6yEev

AI Agent 会自动:

  1. 调用 scripts/pipeline.py 下载视频、提取帧、转录
  2. 对每帧调用视觉模型获取画面描述
  3. 结合音频转录和画面描述生成完整报告

输出报告

报告保存在 {outputdir}/{视频标题}总结报告.md,包含:

  1. 视频概述 — 主题、类型、目标观众
  2. 视频结构 — 按时间线的段落划分
  3. 核心内容 — 逐条还原关键信息(引用原话)
  4. 关键要点 — 3-7 个核心 Takeaway
  5. 视频制作特点 — 拍摄风格、信息呈现方式

视觉模型策略

  • 默认:GLM-4.6V-Flash(智谱免费模型)
  • 兜底:qwen-vl-max(千问付费模型,识别更准)
  • 检测到以下情况自动切换千问:输出 < 50 字、429 限流、数据明显矛盾

许可证

MIT