5分钟跑通:video-analyzer AI视频分析自动把视频变文字 5分钟跑通video-analyzer AI视频分析自动把视频变文字【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzervideo-analyzer是一款可完全本地运行的AI视频分析工具它用视觉大模型加Whisper语音识别自动把视频画面和声音变成文字。读完本文你可以完成安装、跑通第一次视频分析并学会调帧密度和模型参数。 先看效果最终产出是一个output/analysis.json文件里面有完整语音转录、逐帧画面描述和一段按时间顺序组织的视频综合摘要。摘要用自然语言说清视频在讲什么、画面发生了什么加--keep-frames还能保留提取出的关键帧供你核对。完整样例见 docs/sample_analysis.json。 快速上手第一步准备依赖。需要 Python 3.11 以上和 FFmpeg本地跑模型还需装好 Ollama。第二步安装。克隆、建虚拟环境、装包各一条命令sudo apt install ffmpeg git clone https://gitcode.com/gh_mirrors/vi/video-analyzer cd video-analyzer python3 -m venv .venv source .venv/bin/activate pip install .第三步第一次运行。先拉取默认视觉模型再直接跑视频ollama pull llama3.2-vision video-analyzer video.mp4跑完后控制台会打印转录文本和视频摘要完整结果写入output/analysis.json。⚙️ 它是如何工作的全流程分三步1用 OpenCV 计算帧间差异挑出有代表性的关键帧同时用 Whisper 转录音轨2把每个关键帧逐一送给视觉模型每帧描述都带着上一帧的时间上下文3把所有帧描述和转录合并生成最终摘要。上图是项目官方流程图视频输入后先做关键帧选择与音频转录再交给 LLM 逐帧分析最后综合重构出完整描述。 能用来做什么你遇到冗长会议录像要快速抓重点 → 跑一条video-analyzer meeting.mp4 --prompt 提取核心决策和行动项→ 得到一份结构化会议摘要加完整转录。你遇到教学视频想整理知识点 → 跑一条video-analyzer lecture.mp4 --whisper-model large→ 得到带时间戳的转录和关键画面说明。你遇到敏感内容不能上传到云端 → 用默认 Ollama 客户端跑video-analyzer video.mp4→ 全程本机处理数据不出机器。 调参速查表场景关键参数推荐值说明5分钟以内短视频--max-frames30-50帧数越多描述越细30分钟长视频--max-frames20-30均匀抽样避免帧数过多转录精度优先--whisper-modellarge模型越大识别越好CPU 上更慢只想处理开头片段--duration300只处理前 N 秒省时间☁️ 本地还是云端本地默认video-analyzer video.mp4。视频和音频都不离开你的机器隐私最有保障长视频依赖本机硬件速度。云端video-analyzer video.mp4 --client openai_api --api-key sk-xxx --api-url https://api.openai.com/v1 --model gpt-4o能用更强更快的模型适合不敏感的内容。 读懂输出结果都在output/analysis.json四个关键字段{ metadata: { frames_extracted: 5, transcription_successful: true }, transcript: { text: Im scared! }, frame_analyses: [Frame 0: 人物站在黑色塑料容器前...], video_description: { response: The video begins with a person standing in front of a black plastic tub... } }metadata用的模型、提取了几帧、转录是否成功先靠它判断流程是否跑全。transcript完整转录文本segments 里带时间戳。frame_analyses每个关键帧的描述含场景、动作和与上一帧的衔接点。video_description最终摘要也就是你最关心的产出。️ 最常见的3个卡点跑得特别慢先用--duration 60只跑一分钟验证环境长视频再降--max-frames或改用云端。控制台提示转录不可靠多半是音频质量差或视频没有音轨可加--language en指定语言提高置信度。内存不足把--whisper-model降到 small 或 tiny同时调小--max-frames。video-analyzer 把看完整个视频变成读完一份摘要。跑通本地流程后更多参数说明见官方文档 docs/USAGES.md核心流程源码在 video_analyzer/ 目录。【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

最新新闻

7B 模型跑崩三次后,我靠这 4 个技巧在消费级 GPU 上完成了深度学习入门

7B 模型跑崩三次后,我靠这 4 个技巧在消费级 GPU 上完成了深度学习入门

7B 模型跑崩三次后,我靠这 4 个技巧在消费级 GPU 上完成了深度学习入门 从入门到放弃的三次循环 去年双十一抢到的 RTX 3090 在快递柜里躺了两周--每次打开 Jupyter Notebook 准备跑 7B 参数的 LLaMA 微调实验,不是显存爆炸就是训练速度堪比蜗牛。作为刚完成「人工智能入门」课…

2026/8/22 22:30:18
ShawzinBot:把MIDI文件变成Warframe自动演奏的桌面工具

ShawzinBot:把MIDI文件变成Warframe自动演奏的桌面工具

ShawzinBot:把MIDI文件变成Warframe自动演奏的桌面工具 【免费下载链接】ShawzinBot Convert a MIDI input to a series of key presses for the Shawzin 项目地址: https://gitcode.com/gh_mirrors/sh/ShawzinBot ShawzinBot是一款Windows桌面程序&#xff…

2026/8/22 22:30:18
AMD显卡驱动精简工具Radeon Software Slimmer:五步定制轻量驱动

AMD显卡驱动精简工具Radeon Software Slimmer:五步定制轻量驱动

AMD显卡驱动精简工具Radeon Software Slimmer:五步定制轻量驱动 【免费下载链接】RadeonSoftwareSlimmer Radeon Software Slimmer is a utility to trim down the bloat with Radeon Software for AMD GPUs on Microsoft Windows. 项目地址: https://gitcode.com…

2026/8/22 22:30:18
AI编程实战:把老代码重构到能维护

AI编程实战:把老代码重构到能维护

文章目录AI编程实战:把老代码重构到能维护写在前面一、先写保护测试二、让 AI 拆函数三、跑测试 review四、风险控制小结与下篇预告小作业AI编程实战:把老代码重构到能维护 写在前面 “这段代码我都不敢动”——老项目里的面条函数,是很多程…

2026/8/22 22:30:18
html-pdf-chrome 实战指南:HTML 转 PDF

html-pdf-chrome 实战指南:HTML 转 PDF

html-pdf-chrome 实战指南:HTML 转 PDF 【免费下载链接】html-pdf-chrome HTML to PDF or image (jpeg, png, webp) converter via Chrome/Chromium 项目地址: https://gitcode.com/gh_mirrors/ht/html-pdf-chrome 导出的 PDF 排版总跑版、截图脚本总抢跑页面…

2026/8/22 22:30:18
五分钟装好通达信缠论插件:笔和中枢自动画出(ChanlunX 指南)

五分钟装好通达信缠论插件:笔和中枢自动画出(ChanlunX 指南)

五分钟装好通达信缠论插件:笔和中枢自动画出(ChanlunX 指南) 【免费下载链接】ChanlunX 缠中说禅炒股缠论可视化插件 项目地址: https://gitcode.com/gh_mirrors/ch/ChanlunX 通达信缠论插件 ChanlunX 基于 TDXDLL 插件函数&#xff0…

2026/8/22 22:25:17