데이터 수집/자동화 포함 SI 견적에서 리스크 — 차단·로그인·캡차 대응
데이터 수집·업무자동화 외주 개발의 기술적 리스크와 견적 주의사항을 정리했습니다. 대상 사이트의 차단 정책에 따라 난이도와 비용이 갈리고, 로그인·캡차·동적 페이지(SPA) 대응은 공수가 2~3배 늘어납니다. 개인정보보호법·이용약관 등 법적 리스크도 사전 확인이 필수입니다.
- •데이터 수집은 대상 사이트의 차단 정책에 따라 난이도와 비용이 크게 달라집니다.
- •로그인 필요 데이터 수집, 캡차 우회, 동적 페이지(SPA)는 각각 공수가 2~3배 증가합니다.
- •법적 리스크(개인정보보호법, 이용약관)를 반드시 사전에 확인해야 합니다.
데이터 수집 난이도별 분류
| 난이도 | 대상 | 예상 공수 | 비용 범위 |
|---|---|---|---|
| 쉬움 | 정적 HTML, 공개 데이터 | 1~3일 | 50만~150만 원 |
| 보통 | 동적 페이지(JS 렌더링) | 3~7일 | 150만~400만 원 |
| 어려움 | 로그인 필요, Rate Limit | 5~14일 | 300만~800만 원 |
| 매우 어려움 | 캡차, IP 차단, 안티봇 | 2~4주+ | 500만~1,500만 원+ |
대상 사이트를 사전에 분석하지 않으면 견적이 2~5배 틀릴 수 있습니다.
비용을 좌우하는 리스크 요소
1. IP 차단
대량 요청 시 IP가 차단됩니다. 프록시 풀, IP 로테이션이 필요하며 인프라 비용이 추가됩니다.
2. 캡차(CAPTCHA)
reCAPTCHA, hCaptcha 등이 적용된 경우 캡차 해결 서비스 연동이 필요합니다 (월 비용 발생).
3. 로그인/세션 관리
로그인이 필요한 페이지는 세션 유지, 쿠키 관리, 2FA 처리 등 복잡도가 크게 증가합니다.
4. 동적 렌더링(SPA)
React/Vue 등으로 만든 사이트는 Puppeteer/Playwright 같은 브라우저 자동화 도구가 필요합니다.
5. 구조 변경 대응
대상 사이트가 HTML 구조를 변경하면 크롤러가 작동하지 않습니다. 유지보수 계약에 "구조 변경 대응"을 포함해야 합니다.
6. 데이터 정제
원시 데이터를 정제(파싱/클렌징/정규화)하는 공수는 수집 공수와 비슷하거나 더 클 수 있습니다.
데이터 수집 요구사항 정리 체크리스트
법적 주의사항
데이터 수집은 기술적으로 가능하더라도 법적 문제가 있을 수 있습니다.
확인해야 할 사항:
대상 사이트의 robots.txt 정책
이용약관의 자동 수집 금지 조항
개인정보보호법 (개인정보 수집 시)
저작권법 (콘텐츠 무단 복제 시)
정보통신망법 (서비스 운영 방해 시)
공개된 데이터를 개인 용도로 수집하는 것은 대부분 허용되지만, 상업적 이용이나 대량 수집은 법적 검토가 필요합니다.
두 가지만 고르면 됩니다. 연락처 입력 없음, 범위는 실제 수주가 기준입니다.
