Trong quá trình Footprinting & Reconnaissance, một Ethical Hacker cần thu thập càng nhiều thông tin công khai về mục tiêu càng tốt trước khi bước sang các giai đoạn Scanning, Enumeration và Vulnerability Analysis.

Website của một tổ chức là một trong những nguồn thông tin quan trọng trong quá trình này.

Web Data Extractor là công cụ được sử dụng để tự động thu thập và trích xuất nhiều loại dữ liệu từ Website, thay vì phải mở từng trang và tìm kiếm thông tin hoàn toàn thủ công.

Trong các tài liệu và bài thực hành CEH, Web Data Extractor được sử dụng như một ví dụ điển hình cho kỹ thuật Website Footprinting.

Web Data Extractor là gì?

Web Data Extractor của WebExtractor System là phần mềm hỗ trợ crawling và trích xuất dữ liệu từ Website.

Công cụ có thể thu thập nhiều loại thông tin như:

  • URL.
  • Title của trang Web.
  • Meta Description.
  • Meta Keywords.
  • Địa chỉ Email.
  • Số điện thoại.
  • Số Fax.
  • Hình ảnh.
  • Các liên kết và dữ liệu khác xuất hiện trên Website.

Các nguồn lưu trữ phần mềm vẫn ghi nhận Web Data Extractor 8.3 với khả năng quét Website và trích xuất URL, metadata, email, hình ảnh và nhiều loại dữ liệu khác.

Thay vì kiểm tra từng trang Web bằng tay, công cụ có thể crawl nhiều trang và tập hợp kết quả thành một danh sách có cấu trúc để người sử dụng tiếp tục phân tích.


Web Data Extractor được sử dụng ở đâu trong CEH?

Trong CEH, Web Data Extractor liên quan trực tiếp đến:

Footprinting and Reconnaissance

và cụ thể hơn là:

Website Footprinting.

Mục tiêu của giai đoạn này chưa phải là khai thác hệ thống.

Học viên đang cố gắng trả lời những câu hỏi như:

  • Website công khai những thông tin gì?
  • Có những địa chỉ Email nào xuất hiện?
  • Có thể xác định được nhân sự hoặc bộ phận nào của tổ chức?
  • Website có những URL hoặc trang nào đáng chú ý?
  • Metadata của Website cung cấp thông tin gì?
  • Có những tên miền hoặc tài nguyên liên quan nào khác?
  • Những dữ liệu nào có thể được sử dụng cho các bước Reconnaissance tiếp theo?

Một số tài liệu CEH Practical hiện vẫn liệt kê Web Data Extractor như một công cụ dùng để crawl Website và thu thập Meta Tag, Email, số điện thoại và các thông tin liên quan trong quá trình Reconnaissance.


Vì sao Email và Metadata lại quan trọng?

Giả sử một Website công khai các địa chỉ như:

support@example.com

sales@example.com

firstname.lastname@example.com

Đối với người sử dụng bình thường, đây chỉ là thông tin liên hệ.

Nhưng với một Ethical Hacker thực hiện Reconnaissance, chúng có thể giúp nhận diện:

  • Quy ước đặt Email của tổ chức.
  • Tên nhân sự.
  • Phòng ban.
  • Các tài khoản có khả năng tồn tại.
  • Những thông tin có thể được sử dụng trong quá trình Social Engineering có kiểm soát.

Tương tự, Title, Description, Keywords, đường dẫn và các tài nguyên Web cũng có thể giúp người kiểm thử hiểu thêm về cấu trúc và nội dung của hệ thống.

Điểm quan trọng ở đây là:

Một thông tin đơn lẻ có thể không có nhiều giá trị, nhưng khi kết hợp nhiều nguồn Reconnaissance với nhau, chúng có thể tạo thành một bức tranh tương đối đầy đủ về mục tiêu.


Từ Web Data Extraction đến Reconnaissance

Trong CEH, không nên học công cụ một cách độc lập.

Hãy đặt Web Data Extractor vào một quy trình lớn hơn:

Target Identification

Website Footprinting

Web Data Extraction

Email / URL / Metadata Collection

DNS & Domain Reconnaissance

Network Scanning

Enumeration

Vulnerability Analysis

Web Data Extractor chỉ thực hiện một phần trong quy trình đó.

Điều học viên cần hiểu không phải là:

“Bấm nút nào để chạy Web Data Extractor?”

mà là:

“Thông tin tôi vừa thu thập được có thể giúp gì cho bước Reconnaissance tiếp theo?”


Web Data Extractor có còn phù hợp hiện nay không?

Cần phân biệt giữa công cụkỹ thuật.

Phiên bản Web Data Extractor 8.3 được các kho phần mềm ghi nhận là một ứng dụng đã khá lâu không được cập nhật; một nguồn còn lưu ý trực tiếp rằng điểm hạn chế của phần mềm là không được cập nhật gần đây.

Vì vậy, nếu học viên đang sử dụng hệ điều hành và Website hiện đại, không nên xem Web Data Extractor là lựa chọn duy nhất hay công cụ chuẩn hiện nay.

Tuy nhiên, Web Data Extraction và Web Scraping vẫn là những kỹ thuật được sử dụng rộng rãi. Các nền tảng hiện đại vẫn cung cấp khả năng crawl Website, lựa chọn dữ liệu cần thu thập, tự động hóa quá trình extraction và xuất kết quả có cấu trúc.

Do đó, giá trị của bài thực hành vẫn còn nguyên:

Website → Crawl → Extract → Organize → Analyze

Công cụ có thể thay đổi, nhưng phương pháp thu thập và phân tích dữ liệu Website vẫn tiếp tục được sử dụng.


Khi xem lại bài thực hành Web Data Extractor

Nếu bạn đang xem một Video CEH sử dụng phiên bản Web Data Extractor cũ, không cần quá tập trung vào giao diện phần mềm.

Hãy tập trung vào ba vấn đề:

1. Công cụ đang thu thập dữ liệu gì?

Email, URL, metadata, số điện thoại hay thông tin khác?

2. Vì sao thông tin đó có giá trị?

Nó giúp xác định nhân sự, cấu trúc Website, tài nguyên hoặc mở rộng Reconnaissance như thế nào?

3. Bước tiếp theo sẽ là gì?

Thông tin vừa thu thập được có thể được kết hợp với DNS Footprinting, OSINT, Network Scanning hoặc Enumeration như thế nào?

Nếu trả lời được ba câu hỏi này thì bạn đã hiểu mục tiêu thực sự của bài Lab.


Công cụ thay đổi, tư duy Ethical Hacking không thay đổi

Một trong những sai lầm khi học CEH là cố gắng ghi nhớ hàng trăm tên công cụ.

Trong thực tế, một số công cụ sẽ:

  • Ngừng phát triển.
  • Đổi tên.
  • Có phiên bản mới.
  • Được thay bằng công cụ khác.
  • Hoặc được tích hợp vào một nền tảng hiện đại hơn.

Nhưng phương pháp vẫn tồn tại.

Với Web Data Extractor, kiến thức cần ghi nhớ là:

Website Footprinting → Automated Data Collection → Information Analysis → Expanded Reconnaissance.

Đó mới là kiến thức có giá trị lâu dài.


Lưu ý khi thực hành

Các kỹ thuật Web Crawling, Data Extraction và Reconnaissance cần được thực hiện trong môi trường Lab, hệ thống của chính bạn hoặc Website mà bạn được phép kiểm thử.

Mục tiêu của CEH là học cách những kỹ thuật này hoạt động để phục vụ kiểm thử bảo mật và phòng thủ hệ thống, không phải thu thập hoặc sử dụng trái phép dữ liệu của bên thứ ba.


Học CEH từ công cụ đến phương pháp

Web Data Extractor là một ví dụ rất tốt để học viên hiểu rằng Reconnaissance không chỉ đơn giản là chạy một vài lệnh.

Một Ethical Hacker cần biết:

Tìm thông tin ở đâu

Thu thập bằng phương pháp nào

Đánh giá giá trị của thông tin

Liên kết nhiều nguồn dữ liệu

Xác định bước kiểm thử tiếp theo

Đó cũng là phương pháp nên áp dụng xuyên suốt chương trình CEH v13 AI.

Thay vì chỉ ghi nhớ tên công cụ, hãy luôn đặt câu hỏi:

Công cụ này được sử dụng ở giai đoạn nào?

Nó cung cấp thông tin gì?

Thông tin đó giúp ích gì cho bước tiếp theo của quá trình Ethical Hacking?

Khi hiểu được điều đó, ngay cả khi một công cụ cũ được thay thế bằng công nghệ mới, kiến thức và tư duy của bạn vẫn còn nguyên giá trị.

Bình luận về bài viết này

Thịnh hành