video-analyzer 使用指南:本地 AI 视频分析,把视频内容变成文本描述 video-analyzer 使用指南本地 AI 视频分析把视频内容变成文本描述【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzervideo-analyzer 是一个可完全本地运行的 AI 视频分析工具它从视频中自动抽取关键帧并对音频轨做语音转录把画面逐帧交给视觉大模型描述最后把两者融合成一段连贯的 JSON 视频描述。本文以「把一段 45 分钟的会议录像变成可搜索的纪要」为主线带你走完安装、参数调优和本地/云端模型切换的完整路径。先搞清楚三阶段处理链路跑第一条命令之前先理解结果从哪来后面调参才不会绕弯。video-analyzer 的分析分三个阶段阶段一提取OpenCV 从视频里挑出最具代表性的关键帧不是逐帧全取避免对几乎相同的画面重复分析音轨交给 Whisper 做语音转录音频质量不可靠时会自动跳过转录、只分析画面阶段二单帧分析视觉模型按时间顺序逐帧描述每帧的分析结果会作为上下文传给下一帧保证时间线不跳跃阶段三重建把全部帧描述与完整转录合并成最终的视频描述。跑完一轮核心产物是output/analysis.json包含四块metadata模型、帧数等元信息、transcript转录文本及分段起止时间、frame_analyses逐帧描述、video_description整体描述。做会议纪要时主要看后两块。默认情况下中间产物 frames/ 与 audio.wav 会在处理结束后清理命令上加--keep-frames可保留它们以便核对。 最小安装路径依赖、模型与第一条命令系统要求Python 3.11 和 FFmpeg本地跑视觉模型通常建议 16GB 以上内存官方文档给出的参考值是 16GB 起步、32GB 推荐走云端模式则没有这个硬件门槛。git clone https://gitcode.com/gh_mirrors/vi/video-analyzer cd video-analyzer python3 -m venv .venv source .venv/bin/activate pip install .依赖包含 OpenCV、PyTorch、faster-whisper 等首次安装会花几分钟。装好后拉取视觉模型并跑第一次分析ollama pull llama3.2-vision video-analyzer meeting.mp4meeting.mp4换成你的视频文件路径即可。前提是装好 Ollama 且服务在运行安装器一般会配成后台服务否则手动执行ollama serve。整个过程就三步装依赖、拉模型、跑一条命令全程不需要 API key。️ 最常用的三个参数--model用来切换视觉模型默认是 Ollama 上的llama3.2-vision接云端时可改成gpt-4o之类。--prompt给分析追加一个自定义问题比如--prompt 列出达成的决策和各项行动的负责人让输出贴近纪要格式。帧密度没有独立的命令行参数由config/config.json里的frames.per_minute控制默认每分钟 60 帧部分教程里提到的--frames-per-minute指的就是这一项长视频建议直接用--max-frames限制总帧数更可控。参数位置用途--model命令行指定视觉模型默认llama3.2-vision--prompt命令行追加自定义问题控制分析侧重frames.per_minuteconfig/config.json每分钟提取的帧数越大越细--max-frames命令行限制总帧数在全片均匀采样--whisper-model命令行语音识别模型大小默认medium--duration命令行只处理视频前 N 秒☁️ 本地还是云端两种模式默认情况下video-analyzer 把关键帧发给本机的 Ollama 服务视频文件与分析结果全程不出机器。对内部会议这类敏感内容这是选择它的最主要原因你不需要担心录像被上传到任何外部服务。如果想省时间或提高描述质量一条命令就能切换到任意 OpenAI 兼容的云端服务video-analyzer meeting.mp4 --client openai_api \ --api-key sk-xxx --api-url https://openrouter.ai/api/v1 \ --model gpt-4o配置优先级是 命令行 config/config.json 内置默认值你可以把云端配置写进配置文件长期生效也可以每条命令临时传入。进阶长视频拆分与批量处理45 分钟的录像在本地模型上通常能一次跑完但遇到内存或时长限制时有两个现成的开关--duration 1800只处理前 30 分钟--max-frames 60把送入模型的帧数压下来。另一个高频用法是中断或调参后重跑——加上--start-stage 2会跳过提取阶段直接基于已提取的帧继续省掉重新转录音频和抽帧的开销video-analyzer meeting.mp4 --duration 1800 --max-frames 60 video-analyzer meeting.mp4 --start-stage 2 --keep-frames批量处理多个视频用一行 shell 循环即可for v in *.mp4; do video-analyzer $v --output results/${v%.*}; done不需要额外脚本。从你自己的视频文件开始推荐路径先跑video-analyzer 你的视频.mp4在本地把整条链路走通再根据输出结果调--max-frames和--prompt本地效果或速度不满足时再切云端模型对比。下一步动作很简单把你手上任意一段视频的路径填进上面第二条命令回车然后打开output/analysis.json看第一版结果。【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

最新新闻

使用DrissionPage高效爬取招聘数据的技术实践

使用DrissionPage高效爬取招聘数据的技术实践

1. 项目背景与核心需求最近在帮朋友做一个人才市场分析的小工具,需要从招聘平台获取一些职位数据。传统爬虫方案要么容易被反爬机制拦截,要么需要处理复杂的动态页面逻辑。经过一番调研,最终选择了基于DrissionPage的方案来解决这个问题。Dri…

2026/8/23 6:51:04
基于Spring Boot的居民健康档案管理系统(源码+lw+部署文档+讲解等)

基于Spring Boot的居民健康档案管理系统(源码+lw+部署文档+讲解等)

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

2026/8/23 6:51:04
游戏彩蛋进度追踪系统设计与密码缺失排查实践

游戏彩蛋进度追踪系统设计与密码缺失排查实践

在游戏开发与运营过程中,内容更新、版本迭代和玩家社区互动是维持项目活力的关键。当开发者通过“彩蛋”或隐藏内容来增加游戏趣味性时,如何设计、追踪并最终向玩家揭示这些内容,就成了一项融合了技术、创意和社区管理的综合工程。本文将以一…

2026/8/23 6:51:04
PyCharm社区版从零安装配置指南:Python开发环境高效搭建

PyCharm社区版从零安装配置指南:Python开发环境高效搭建

1. 项目概述:为什么选择PyCharm社区版作为Python开发起点如果你正准备踏入Python编程的世界,或者想从零散的脚本编写转向更专业的项目开发,那么一个趁手的集成开发环境(IDE)绝对是你的第一块敲门砖。在众多选择中&…

2026/8/23 6:51:04
金融场景Agent算法岗面试核心要点解析

金融场景Agent算法岗面试核心要点解析

1. 面试背景与岗位解析最近参加了平安科技Agent算法岗的二面,这个岗位主要聚焦于智能体(Agent)技术在金融场景的应用开发。从面试官的问题方向来看,他们特别关注候选人在以下三个维度的能力:一是对强化学习、多智能体系统等核心算法的掌握深度…

2026/8/23 6:51:04
铁路障碍物检测数据集 | 5400张YOLO铁路安全数据集

铁路障碍物检测数据集 | 5400张YOLO铁路安全数据集

铁路障碍物检测数据集 | 5400张YOLO铁路安全数据集 适用于铁路安全巡检、障碍物预警与目标检测研究 一、数据集概述 本数据集面向计算机视觉目标检测任务,专为铁路沿线障碍物的检测模型训练、验证与测试设计,共包含约5400张高质量标注图像,…

2026/8/23 6:46:04