HMSearchBot
v1.0HMSearchBot은 HMSOFT가 운영하는 검색 엔진 HMSEARCH(search.hmsoft.it.kr)의 수집기입니다. 승인된 소스 허용목록만, 사이트에 부담을 주지 않는 속도로 수집합니다.
식별 정보
HMSearchBot/1.0 (+https://search.hmsoft.it.kr/bot; ceo@hmsoft.it.kr)
위 User-Agent 문자열로 요청하며, 요청 헤더에 항상 이 페이지 주소와 연락처를 포함합니다. 이 UA를 사칭한 다른 트래픽은 저희와 무관합니다 — 의심 사례는 아래 연락처로 알려주세요.
수집 원칙
- 허용목록 방식 — 승인된 소스만 수집합니다
웹 전체를 긁지 않습니다. 법적 검토(이용약관·라이선스)와 신뢰 평가를 통과해 사람이 승인한 도메인만 수집 대상입니다.
- robots.txt 준수 (RFC 9309)
Disallow·Allow·Crawl-delay 지시를 준수하며 24시간마다 재확인합니다. robots.txt 조회에 실패하면 수집하지 않습니다.
- 보수적인 요청 속도
도메인당 동시 연결 1개, 기본 요청 간격 1초 이상(사이트가 지정한 Crawl-delay가 있으면 그 값), 조건부 요청(ETag/If-Modified-Since)으로 불필요한 재전송을 줄입니다.
- 429·403 존중과 자동 중단
Retry-After를 존중하고 지수 백오프로 물러납니다. 차단 신호가 반복되면 해당 소스 수집을 자동 중단하고 원인을 조사합니다.
- noindex·nofollow 존중
meta robots와 X-Robots-Tag의 noindex는 색인 제외, nofollow는 링크 미추적으로 처리합니다.
- 뉴스 콘텐츠는 본문을 저장하지 않습니다
언론사 소스는 뉴스 사이트맵에서 제목·링크·게시시각만 수집하며, 기사 본문은 요청하지도 저장하지도 않습니다.
차단 방법
HMSearchBot의 수집을 원치 않으면 robots.txt에 아래 두 줄을 추가하세요. 24시간 이내에 반영되며, 이미 색인된 문서도 재확인 시점에 제거됩니다.
User-agent: HMSearchBot
Disallow: /
특정 경로만 제외하려면 Disallow에 해당 경로를 지정하면 됩니다. robots.txt 수정이 어렵거나 즉시 제거가 필요한 경우 아래 연락처로 요청해 주세요 — 확인 후 우선 처리합니다.