목차
2026-07-19 세션 — ytmine 유튜브 영상 자료수집 파이프라인 신규 구축
논의 · 대안
- 발단: 페페가 유튜브(주로 한국어 AI개발 영상)를 다 안 보고 코디가 자막+나레이션을 자료수집하게 하려는 목적. 잘 되면 가구 등 확장.
- 오픈소스 조사 4티어: 자막 MCP(설치됨) / 자막+분석강화(wynandw87 챕터·SponsorBlock·히트맵) / 프레임비전(codependentai/video-watch-mcp·guimatheus92/mcp-video-analyzer) / Gemini 네이티브 멀티모달.
- STT 백엔드 대안 저울질: CPU(0.73x 느림) vs Groq(200x·무료티어) vs NVIDIA 무료(canary-1b-asr 한국어 지원하나 rate limit) vs 780M iGPU(whisper.cpp Vulkan, faster-whisper는 AMD 미지원).
- 중요 교정: 전사(STT)는 Claude 에이전트로 불가(오디오 입력 안 됨). "에이전트로 전사 가속"은 성립 X — 전사=Groq/로컬, 에이전트 병렬은 마이닝(분석) 단계용(페페 지적은 마이닝엔 정확).
결정 (grillme 5건 + 백엔드)
- [D1] 하이브리드(로컬 CLI 코어 + 자막 MCP) · [D2] 수동자막만 신뢰·나머지 STT · [D3] 자막+나레이션 우선·비주얼 v2 · [D4] 토큰절약=로컬 전처리(토큰0)+마이닝만 격리 Workflow · [D5] 열린 키워드
--domain.
- STT 백엔드: Groq 먼저 완성 + 780M 백그라운드(페페 선택). NVIDIA는 rate limit이라 접음.
산출물
C:\dev\ytmine\ytmine.py (search/estimate/process/batch/selfcheck) + .env/.env.example/.gitignore + models/ggml-medium-q5_0.bin(539MB).
- STT 어댑터:
local(faster-whisper CPU, talklog venv 재사용) + groq(whisper-large-v3-turbo). --backend 플래그.
- 전사시간 예상(
estimate) + batch 확인 게이트 + RTF 노브(자동: local 0.75/groq 0.01).
- 검증: selfcheck·search·estimate PASS. E2E STT 11:27 영상 CPU 503s(0.73x). Groq estimate 큐5건 CPU 2h34m→2m3s. Groq 키 인증 OK(전사는 다음 세션).
- 전사 밀도 실측: 분당 ~413tok, 1시간≈2.5만tok. 안전 전사분량 ≈ 2시간 영상/에이전트.
- 기본 지침: 전역 CLAUDE.md "유튜브·영상 분석=ytmine" 섹션 +
/ytmine skill(~/.claude/skills).
- user_brief 편입(ytmine-handoff) + devplan
ytmine.html(index 카드).
커밋 / 다음
- user_brief 로컬 커밋:
ac7f8c0(신설) · 9e374f1(예상시간) · 730ecb1(Groq 백엔드) · d64fa2e(기본지침). push 안 함.
- 다음(페페 예정): 새 세션에서
/ytmine skill 로딩과 함께 첫 Groq 전사 E2E 테스트. 이후 = 마이닝 Workflow(kakao 3단 이식)·KB 스키마·780M whisper.cpp Vulkan 빌드·비주얼 v2(프레임/OCR).
관계
- 재사용 자산: talklog faster-whisper venv, kakao-mining 3단 Workflow, furniture-kb(KB 패턴). domain:agent 파이프라인, svc:stt 전사, domain:ops 자동화.