Glossary · 업무자동화

스크래핑·크롤링 Web Scraping / Crawling

용어 사전 · 안녕소프트 최재원 · 2026. 9. 22. 작성

스크래핑·크롤링은 웹사이트에 표시된 정보를 프로그램이 자동으로 읽어 와 정리된 데이터로 만드는 기술입니다. 경쟁사 가격, 공고 목록, 거래처 사이트의 주문 내역을 매일 사람이 복사해 엑셀에 붙이고 있다면 스크래핑의 대상입니다. 크롤링과 같은 뜻으로 쓰이는 경우가 많지만 엄밀히는 역할이 다르고, 화면을 조작하는 RPA와도 구분됩니다. 무엇보다 대상 사이트가 허용하는 범위 안에서만 써야 합니다.

스크래핑과 크롤링의 차이

두 용어는 실무에서 섞여 쓰이지만 역할이 다릅니다. 크롤링은 링크를 따라다니며 페이지를 수집하는 일입니다. 검색엔진이 웹 전체를 돌며 페이지를 모으는 것이 대표적인 크롤링입니다. 어떤 페이지가 있는지 찾아내는 것이 목적이고, 페이지 내용을 세밀하게 해석하지는 않습니다.

스크래핑은 특정 페이지에서 필요한 값만 뽑아내는 일입니다. 상품 페이지에서 상품명·가격·재고 여부만 골라 표로 만드는 식입니다. 어느 페이지를 볼지는 이미 알고 있고, 그 안의 어느 부분이 필요한지를 정해 추출합니다.

실무 자동화는 대부분 스크래핑에 가깝습니다. 예를 들면 다음과 같습니다.

  • 거래처 포털에서 주문·정산 목록을 읽어 엑셀로 정리
  • 공공기관 사이트의 입찰 공고를 조건에 맞게 수집
  • 자사 상품이 올라간 판매 채널의 가격과 노출 상태 점검

두 개념을 합쳐 쓰는 경우도 있습니다. 목록 페이지를 크롤링해 상세 페이지 주소를 모으고, 각 상세 페이지를 스크래핑해 값을 뽑는 구조입니다. 어느 쪽이든 결과물은 사람이 복사해 붙이던 것과 같은 정형 데이터입니다.

RPA와 무엇이 다른가

스크래핑과 RPA는 모두 웹사이트를 상대로 움직이지만 방향이 다릅니다. 스크래핑은 읽어 오는 것이 목적입니다. 페이지의 내용을 가져와 데이터로 만드는 데서 끝납니다. RPA는 사람의 조작을 대신하는 것이 목적입니다. 로그인하고, 메뉴를 누르고, 값을 입력하고, 저장하는 일련의 동작을 수행합니다.

기술적으로도 다릅니다. 스크래핑은 보통 화면을 띄우지 않고 페이지 데이터를 직접 받아 해석하므로 빠르고 가볍습니다. RPA는 실제 화면을 열어 사람처럼 움직이므로 느리지만, 입력과 저장처럼 쓰기 동작이 가능합니다.

선택 기준은 단순합니다.

  • 읽기만 필요하고 로그인 없이 볼 수 있는 페이지라면 스크래핑
  • 로그인 뒤 여러 화면을 거치며 입력·저장이 필요하면 RPA
  • 둘이 섞인 업무라면 RPA 안에서 읽기 구간만 스크래핑 방식으로 처리

둘 다 상대 사이트의 화면이나 구조에 의존한다는 공통점이 있습니다. 상대가 API를 제공한다면 스크래핑도 RPA도 아닌 API 연동이 가장 안정적인 선택입니다.

사이트 정책 안에서만 쓰는 원칙

스크래핑은 기술적으로 가능한 것과 해도 되는 것이 다릅니다. 사이트마다 이용약관과 자동 접근에 대한 정책이 있고, 그 범위를 벗어나면 서비스 이용 제한이나 분쟁의 원인이 됩니다. 원칙은 다음과 같습니다.

  • 이용약관을 먼저 확인합니다. 자동 수집을 명시적으로 금지한 사이트는 대상에서 제외합니다
  • 접근 제한을 우회하지 않습니다. 로그인 벽, 자동 접근 차단, 봇 확인 절차를 피해 가는 방법은 쓰지 않습니다
  • 사이트에 부담을 주지 않습니다. 짧은 시간에 대량 요청을 보내지 않고, 필요한 페이지만 간격을 두고 가져옵니다
  • 개인정보와 저작물은 별도로 봅니다. 개인정보가 포함된 데이터나 저작권이 있는 콘텐츠는 수집 자체를 원칙적으로 피합니다
  • 우리 계정으로 볼 수 있는 우리 데이터가 가장 안전한 대상입니다. 거래처 포털의 우리 회사 주문 내역처럼 이미 열람 권한이 있는 자료가 여기에 해당합니다

이 원칙은 기술 문제가 아니라 관계의 문제입니다. 거래처나 플랫폼과 계속 거래해야 한다면 그쪽 정책을 존중하는 것이 결국 우리에게 이익입니다. 판단이 어려운 경우에는 상대에게 자동 수집 가능 여부나 API 제공 여부를 직접 문의하는 것이 가장 확실합니다.

사이트 구조가 바뀌면 깨지는 이유

스크래핑 프로그램은 페이지 안에서 원하는 값이 어디에 있는지를 기준으로 동작합니다. 표의 세 번째 열, 특정 이름이 붙은 영역, 이런 식의 위치 정보입니다. 사이트가 디자인을 바꾸거나 메뉴 구조를 개편하면 이 위치가 달라져 값을 찾지 못하거나 엉뚱한 값을 가져옵니다.

더 곤란한 경우는 조용히 틀리는 것입니다. 멈추면 바로 알 수 있지만, 가격 자리에 다른 숫자가 들어와도 형식이 같으면 프로그램은 정상으로 처리합니다. 그래서 스크래핑 결과에는 검증 규칙이 필요합니다.

  • 가져온 건수가 평소와 크게 다르면 경고
  • 필수 항목이 비어 있으면 실패로 처리
  • 값의 범위가 상식을 벗어나면 담당자 확인
  • 페이지 구조가 예상과 다르면 저장하지 않고 알림

사이트 개편은 막을 수 없으므로 깨졌을 때 빨리 알고 빨리 고치는 체계가 답입니다. 개편이 잦은 사이트라면 수정 대응 조건을 처음부터 정해 두고, 가능하면 파일 다운로드나 API처럼 구조 변화에 덜 흔들리는 경로를 우선 검토합니다.

크롤링·스크래핑·RPA 비교
구분크롤링스크래핑RPA
목적페이지를 찾아 모음페이지에서 값을 추출사람의 조작을 대신 수행
동작링크를 따라 이동정한 페이지의 정한 위치를 읽음화면을 열어 클릭·입력·저장
쓰기 동작없음없음가능
속도빠름빠름느림(실제 화면 구동)
깨지는 조건링크 구조 변경페이지 구조 변경화면·메뉴 변경

스크래핑·크롤링 자주 묻는 질문

스크래핑은 합법인가요?

일률적으로 답할 수 없고 사이트의 약관, 데이터의 성격, 수집 방식에 따라 다릅니다. 원칙은 약관이 허용하는 범위에서, 접근 제한을 우회하지 않고, 개인정보와 저작물을 피하는 것입니다. 판단이 어려운 사안은 법률 자문을 받거나 상대에게 직접 확인하는 것이 안전합니다.

로그인이 필요한 사이트도 스크래핑할 수 있나요?

우리 계정으로 정당하게 볼 수 있는 자료라면 가능한 경우가 많습니다. 다만 이 경우 스크래핑보다 RPA에 가까운 구성이 되고, 해당 사이트의 자동 접근 정책을 먼저 확인해야 합니다. 차단 장치를 피해 가는 방식은 쓰지 않습니다.

사이트가 바뀌면 매번 다시 만들어야 하나요?

전체를 다시 만드는 것이 아니라 값을 찾는 위치 정보만 고치는 경우가 대부분입니다. 검증 규칙과 실패 알림이 있으면 바뀐 날 바로 알 수 있습니다. 수정 대응 범위를 처음 계약 때 정해 두면 비용 예측이 쉬워집니다.

실무에서 이 개념이 어떻게 쓰이는지는 RPA와 엑셀 매크로, 무엇이 다른가 · RPA 업무자동화 서비스 · 골프장 예약 자동화 방지 솔루션 에 정리했습니다.

스크래핑·크롤링, 우리 회사 업무에 어떻게 적용할지 궁금하시다면

지금 쓰시는 엑셀이나 업무 순서를 알려주시면, 어디까지 시스템으로 옮길 수 있는지 단계별로 정리해 드립니다.

무료 상담 문의

관련 서비스 — RPA 업무자동화 · 함께 보는 용어 — API 연동 · EDI · OCR · RPA · 엑셀 매크로(VBA) · 용어 사전 전체