Skip to content

优化通用视频多模态解析与本地模型总结#2

Draft
Entropy-R wants to merge 1 commit into
mainfrom
codex/multimodal-video-analysis
Draft

优化通用视频多模态解析与本地模型总结#2
Entropy-R wants to merge 1 commit into
mainfrom
codex/multimodal-video-analysis

Conversation

@Entropy-R

Copy link
Copy Markdown
Owner

改动内容

  • 保留默认快速解析流程,新增显式 --with-vision 多模态解析模式。
  • 接入本机 Ollama/Qwen3-VL 完成关键帧理解和默认最终总结,同时保留 OpenAI 兼容 API 路径。
  • 根据视频时长自适应采样,加入镜头检测、感知哈希去重、视觉批次降级和阶段缓存。
  • 将字幕/语音与画面证据按时间轴融合,压缩重复 OCR,并优先保留命令、URL 等关键字面证据。
  • 改进 B 站自动字幕识别、登录态提示、Whisper 上下文和运行元数据。
  • 明确“快速解析”和“多模态解析”两种产品模式,并新增 32 项自动化测试。

原因与影响

原流程只依赖字幕或 Whisper,容易遗漏 PPT、代码、图表和操作步骤。旧视觉链路还存在固定采样、重复画面、上下文冗余和本地模型批次超限问题。本次调整使用通用的时长与内容自适应策略,不包含针对单个视频的规则。

默认行为保持不变:未传 --with-vision 时不下载或分析画面。启用多模态模式后,语音/字幕与画面均作为重要证据;本地测试样本的完整视觉链路耗时由约 20 分 36 秒降低至约 9 分 43 秒。

验证

  • python3 -m py_compile video_summary.py
  • python3 -m unittest discover -s tests -v(32 项通过)
  • docker compose config -q
  • git diff --check
  • Docker 镜像重建及容器 CLI 文案验证通过
  • B 站样本完成缓存与非缓存多模态回归

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant