HMSEARCH CRAWLER

HMSearchBot

v1.0

HMSearchBot은 HMSOFT가 운영하는 검색 엔진 HMSEARCH(search.hmsoft.it.kr)의 수집기입니다. 승인된 소스 허용목록만, 사이트에 부담을 주지 않는 속도로 수집합니다.

식별 정보

HMSearchBot/1.0 (+https://search.hmsoft.it.kr/bot; ceo@hmsoft.it.kr)

위 User-Agent 문자열로 요청하며, 요청 헤더에 항상 이 페이지 주소와 연락처를 포함합니다. 이 UA를 사칭한 다른 트래픽은 저희와 무관합니다 — 의심 사례는 아래 연락처로 알려주세요.

수집 원칙

  • 허용목록 방식 — 승인된 소스만 수집합니다

    웹 전체를 긁지 않습니다. 법적 검토(이용약관·라이선스)와 신뢰 평가를 통과해 사람이 승인한 도메인만 수집 대상입니다.

  • robots.txt 준수 (RFC 9309)

    Disallow·Allow·Crawl-delay 지시를 준수하며 24시간마다 재확인합니다. robots.txt 조회에 실패하면 수집하지 않습니다.

  • 보수적인 요청 속도

    도메인당 동시 연결 1개, 기본 요청 간격 1초 이상(사이트가 지정한 Crawl-delay가 있으면 그 값), 조건부 요청(ETag/If-Modified-Since)으로 불필요한 재전송을 줄입니다.

  • 429·403 존중과 자동 중단

    Retry-After를 존중하고 지수 백오프로 물러납니다. 차단 신호가 반복되면 해당 소스 수집을 자동 중단하고 원인을 조사합니다.

  • noindex·nofollow 존중

    meta robots와 X-Robots-Tag의 noindex는 색인 제외, nofollow는 링크 미추적으로 처리합니다.

  • 뉴스 콘텐츠는 본문을 저장하지 않습니다

    언론사 소스는 뉴스 사이트맵에서 제목·링크·게시시각만 수집하며, 기사 본문은 요청하지도 저장하지도 않습니다.

차단 방법

HMSearchBot의 수집을 원치 않으면 robots.txt에 아래 두 줄을 추가하세요. 24시간 이내에 반영되며, 이미 색인된 문서도 재확인 시점에 제거됩니다.

User-agent: HMSearchBot

Disallow: /

특정 경로만 제외하려면 Disallow에 해당 경로를 지정하면 됩니다. robots.txt 수정이 어렵거나 즉시 제거가 필요한 경우 아래 연락처로 요청해 주세요 — 확인 후 우선 처리합니다.

연락처

수집 관련 문의·차단 요청·삭제 요청: ceo@hmsoft.it.kr

저작권자의 삭제 요청은 확인 즉시 해당 문서를 색인에서 제거하고 재수집 대상에서 제외합니다.