প্রকল্প সম্পর্কে

Claude Video (/watch) একটি ওপেন-সোর্স স্কিল, যা AI কোডিং এসিস্ট্যান্টকে ভিডিও কন্টেন্ট বিশ্লেষণ করার ক্ষমতা দেয়। ডিফল্টভাবে, এই এজেন্টরা ওয়েবপেজ পড়তে এবং স্ক্রিপ্ট চালাতে পারে, কিন্তু ভিডিও প্রসেস করতে পারে না। এই টুলটি ডাউনলোড, ফ্রেম এক্সট্রাকশন এবং ট্রান্সক্রিপশন সমন্বয় করে, তারপর ফলাফল AI-এর মাল্টিমোডাল কন্টেক্স্টে তুলে দেয়। **সাপোর্টেড হোস্ট:** Claude Code, Codex, Cursor, Copilot, Gemini CLI, claude.ai web এবং ৫০টিরও বেশি অন্যান্য Agent Skills হোস্ট। **কীভাবে কাজ করে:** 1. একটি URL (YouTube, TikTok, Loom, Vimeo ইত্যাদি) বা লোকাল ফাইল পা (.mp4, .mov, .mkv, .webm) গ্রহণ করে। 2. yt-dlp ব্যবহার করে প্রথমে নেটিভ ক্যাপশন সংগ্রহ করে (বিনামূল্যে, ডাউনলোড প্রয়োজন নেই)। অনুপলব্ধ হলে, প্রয়োজনীয় অডিও/ভিডিও ডাউনলোড করে। 3. ffmpeg ব্যবহার করে নির্বাচিত detail mode অনুযায়ী ফ্রেম এক্সট্রাক্ট করে: efficient (দ্রুত keyframes), balanced (scene-change detection), বা token-burner (uncapped scene candidates)। 4. Groq-এর whisper-large-v3 (পREFERRED) বা fallback হিসেবে OpenAI-এর whisper-1 দিয়ে অডিও ট্রান্সক্রাইব করে। 5. AI প্রতিটি ফ্রেমকে একটি ইমেজ হিসেে এবং timestamped transcript-এর পাশাপাশি পড়ে, যাতে প্রকৃত ভিজ্যুয়াল এবং অডিও কন্টেন্টের ভিত্তিতে প্রশ্নের উত্তর দিতে পারে। **মূল বৈশিষ্ট্য:** - Frame deduplication: pure-stdlib Python mean absolute difference algorithm ব্যবহার করে প্রায় একই রকম ফ্রেম (যেমন, স্থির স্লাইড) বাদ দেয়, যা token budget সাশ্রয় করে। - Detail modes: স্পিড/টোকেন খরচের বিনিময়ে ভিজ্যুয়াল fidelity নিয়ন্ত্রণ করে, এবং দীর্ঘ ভিডিওতে context budget শেষ হওয়া রোধে সীমা রাখে। - Focused analysis: --start/--end ফ্ল্যাগ সাপোর্ট করে, নির্দিষ্ট ভিডিও অংশে প্রতি সেকেন্ডে ন ফ্রেম বাজেটের জন্য। - Zero-config setup: macOS-এ brew দিয়ে ffmpeg এবং yt-dlp অটো-ইনস্টল করে; Linux/Windows-এ সুনির্দিষ্ট কমান্ড প্রিন্ট করে। **সাধারণ ব্যবহার:** ভাইরাল কন্টেন্ট স্ট্রাকচার বিশ্লেষণ, স্ক্রিন রেকর্ডিং থেকে বাগ ডায়াগনোসিস, দীর্ঘ ভিডিও সারসংক্ষেপ, লঞ্চ আপডেট থেকে মূল তথ্য বের করা, এবং প্লেইলিস্টকে সার্চযোগ্য নোটে রূপান্তর।