10.9 KB · 수정 2026-08-19 10:42
목차

cody-vision — 코디 정밀 시각 도구 (handoff)

C:\dev\tools\cody-vision = 이미지를 넣으면 사물의 형태·종류·위치·개수·문자를 텍스트 감정서로 풀어주는 CLI. 코디가 Bash로 돌리고 stdout을 읽어 자기 눈과 대조한다(두 번째 의견 + 수치 근거). devplan 추적 페이지 = C:\dev\devplan\cody-vision.html (http://localhost:8799/cody-vision.html) — 매 답변 끝 동시 갱신 대상. 계획 원본 = C:\Users\delix\.claude\plans\warm-twirling-blanket.md.

🔶 루트 NOW 이관 — 진행·미결 (2026-08-19 대청소, 페페 지시)

루트 HANDOFF.md를 pncad 만 남기고 비웠다. 아래는 그때 옮겨온 원문(문구 무변경).

NOW

불변 핵심 (실측 26.7.29, bench.py/bench_real.py)

사용법

MCP(기본) — 툴 목록의 vision 호출. vision(path, question?, mode?, deep?, tiles?, style?, raw?). raw=true면 마크다운 대신 구조화 JSON(좌표를 코드로 쓸 때). 서버가 죽지 않게 모든 실패는 {ok:false, error}로 온다.

Bash(같은 코드)

PYTHONUTF8=1 python C:/dev/tools/cody-vision/vision.py <이미지…> [-q "질문"]
    [-m auto|doc|photo|field|qa] [--deep] [--enum|--group] [--tiles N] [--json] [--no-cache]
PYTHONUTF8=1 python C:/dev/tools/cody-vision/vision.py --selftest    # API 0, 14항목

함정 (실측으로 이미 밟음)

탈락 후보 (재투입 조건 명시 — 상세는 devplan 페이지)

후보 사유 / 재투입 조건
Groq (Llama 4 Scout) 키 403 + 무료 6K TPM = 분당 3~4장 한계. Gemini 쿼터(1,500 RPD) 모자랄 때만
Cerebras 최속이나 이미지는 gemma-4-31b만 + 무료 컨텍스트 8,192 상한
GCV / Azure Dense Captions 라벨만 나오고 서술 없음 / 리전 제한
로컬 VLM 전부(Qwen3-VL+llama.cpp Vulkan) 780M Vulkan으로 실제로 돈다(3B Q4 30~50 tok/s). 폐기 사유는 느려서지 못 돌아서가 아니다 — 페페 결정
RapidOCR(ONNX 한국어, 80MB) Gemini보다 빠르고 torch 불필요. 견적·도면 숫자를 실제로 오독하면 그때 투입
Florence-2 / moondream2 / YOLOE 영역별 상세 서술 또는 겹친 물체 정밀 카운트가 enum+타일링으로도 막힐 때
RAM++/Grounded-SAM, DAM-3B, CountGD torch 수GB 스택 / 연구코드

참고 — 이 PC 하드웨어 (26.7.29 실측)

AMD Ryzen 7 8745HS / Radeon 780M (RDNA3 12CU) / RAM 32GB / vulkan-1.dll ✓ / 디스크 733GB. "NVIDIA 없어서 로컬 불가"는 오판이었다 — Vulkan 경로로 4B~8B 비전모델이 넉넉히 돈다.

HANDOFF 에서 이관 (2026-08-18)