https://summing-up.netlify.app/
브라우저에서 WebGPU/WebAssembly로 로컬 LLM 추론. 문서는 클라이언트에서만 처리(API 키 없음).
npm install
npm run devChrome/Edge, WebGPU 활성화 권장. 최초 모델 다운로드에 시간 소요.
- Microsoft Edge로 열기 (Chrome만 실패하는 경우 많음)
- 앱에서 WebLLM 캐시 삭제 → 모델 재로드
- 모델을 Qwen2.5 0.5B q4f32 로 변경
- GPU 드라이버 업데이트
그래도 실패 시 WebGPU 오류 후 로컬 키워드 요약으로 자동 폴백됩니다.
- 전처리 — 공백 정리, 문단 분리, ~2800자 청킹
- HTML — Readability로 본문만 추출
- WebLLM —
Llama-3.2-1B-Instruct-q4f16_1-MLC- 짧은 글: 1회 요약
- 긴 글: 청크별 요약 → 통합 (map-reduce)
- 출력 — 마크다운 / 표 / plain
src/hooks/useWebLLM.js # 모델 로드, 진행률, 스트리밍
src/lib/preprocess.js
src/lib/extractArticle.js
src/lib/llmSummarize.js
src/App.jsx
「모델만 미리 로드」→ 진행률 확인 → 샘플/기사 붙여넣기 → 요약하기 → 스트리밍·결과 확인