doc-scraper: Go crawler ที่สร้างบริบทเอกสารในท้องถิ่นสำหรับ LLMs
doc-scraper โดย Sriram PR รวบรวมเอกสารเว็บไซต์ทางเทคนิคและเตรียมพร้อมสำหรับการทำงานที่ช่วยด้วย AI แอปนี้จะค้นหาเว็บไซต์เอกสารและดึงเนื้อหาที่อ่านได้ซึ่งได้รับการปรับให้เหมาะสมสำหรับการใช้เป็นบริบทของโมเดล โดยมุ่งเป้าไปที่นักพัฒนาและนักวิจัย AI มันเน้นผลลัพธ์ที่สะอาดและค้นหาได้และร้านค้าความรู้ในท้องถิ่นเพื่อให้ผู้ช่วยที่ใช้โปรแกรมแก้ไขสามารถเข้าถึงวัสดอ้างอิงที่เกี่ยวข้องได้โดยไม่ต้องดึงหน้าเว็บที่มีเสียงรบกวนระหว่างการสร้างคำสั่ง
แปลง HTML ของไซต์เป็น Markdown ที่มีโครงสร้างซึ่งเหมาะสำหรับบริบทของโมเดล
เครื่องมือเป็นเว็บครอว์เลอร์ที่ใช้ Go ซึ่งแปลง HTML ของเอกสารเป็น Markdown ที่มีโครงสร้าง โดยลบแถบนำทาง ฟุตเตอร์ และส่วนที่ไม่ใช่เนื้อหาอื่น ๆ การแปลงนี้จะรักษาหัวข้อและโค้ดในบรรทัดในขณะที่ลดเสียงรบกวนจากข้อความ ผลลัพธ์คือไฟล์คอร์ปัสที่กระชับซึ่งรักษาบริบทการนำทางผ่านหัวข้อและลิงก์ที่ชัดเจนเพื่อให้การดึงข้อมูลและการอ้างอิงโดยการทำงานของโมเดลในลำดับถัดไปทำได้ง่ายขึ้น
การค้นหาและการตรวจจับการเปลี่ยนแปลงทำให้คอร์ปัสเชื่อถือได้สำหรับตัวแทน
แอปฝังการค้นหา BM25 แบบออฟไลน์ที่ใช้ SQLite FTS5 ทำให้สามารถสอบถามท้องถิ่นกับคอร์ปัสที่ถูกครอว์ลโดยไม่ต้องใช้อินเทอร์เน็ต การเก็บสถานะด้วย BadgerDB และ SQLite สนับสนุนการดำเนินการที่สามารถดำเนินต่อได้และดัชนีประวัติ กลไกการเปรียบเทียบที่ตระหนักถึงเนื้อหาจะระบุการเปลี่ยนแปลงของหน้าแท้จริงแทนที่จะพึ่งพาเวลาเพียงอย่างเดียว ซึ่งช่วยลดการดาวน์โหลดที่ซ้ำซ้อนและทำให้คอร์ปัสท้องถิ่นมุ่งเน้นไปที่การแก้ไขที่สำคัญ
รูปแบบการป้อนข้อมูลและขีดจำกัดการครอว์ลกำหนดว่ามันประสบความสำเร็จที่ไหน
doc-scraper ตรวจจับเฟรมเวิร์กเอกสารโดยอัตโนมัติ เช่น Docusaurus, MkDocs, Sphinx, GitBook และ ReadTheDocs และใช้ตัวดึงข้อมูลที่อิงจากความสามารถในการอ่านในไซต์ที่ไม่คุ้นเคย การครอว์ลทำงานพร้อมกันด้วยการจัดการทรัพยากรที่ใช้ร่วมกันและการจำกัดอัตราที่สร้างขึ้น และครอว์เลอร์เคารพ robots.txt เพื่อให้สุภาพ ขอบเขตเหล่านั้นให้ความสำคัญกับการดึงเนื้อหาที่เกี่ยวข้องกับนักพัฒนาในขณะที่หลีกเลี่ยงการโหลดเครือข่ายที่มากเกินไป
การโฮสต์ MCP ในท้องถิ่นเหมาะสำหรับการทำงานของ AI ที่มุ่งเน้นผู้แก้ไขและความต้องการด้านความเป็นส่วนตัว
เมื่อทำงานในโหมดเซิร์ฟเวอร์ แอปทำหน้าที่เป็นเซิร์ฟเวอร์ Model Context Protocol เพื่อให้ตัวแทน AI ในท้องถิ่นสามารถอ่านและค้นหาเอกสารภายในโปรแกรมแก้ไข ฐานความรู้ในท้องถิ่นแบบออฟไลน์ออกแบบให้เอกสารที่ค้นหาได้พร้อมใช้งานสำหรับตัวแทนเช่น Claude Desktop, Claude Code และ Cursor ลดการพึ่งพาการดึงข้อมูลจากระยะไกล เครื่องมือได้รับการกล่าวถึงในชุมชนผู้พัฒนา Go และ AI สำหรับการผลิตผลลัพธ์ที่สะอาดในไซต์ที่เครื่องมือดึงข้อมูลอื่น ๆ ประสบปัญหา
เหมาะที่สุดสำหรับนักพัฒนาที่มีความเชี่ยวชาญทางเทคนิคซึ่งสามารถสร้างและโฮสต์บริบทท้องถิ่น
doc-scraper เป็นตัวเลือกที่ใช้งานได้จริงสำหรับนักพัฒนาและนักวิจัยที่ต้องการเอกสารที่สามารถตรวจสอบได้และโฮสต์ในท้องถิ่นเป็นบริบทของโมเดล เนื่องจากเครื่องมือต้องการการสร้างจากซอร์สด้วย Go (เวอร์ชัน 1.25 หรือใหม่กว่า) จึงเหมาะสำหรับผู้ใช้ที่มีความสามารถทางเทคนิค ทีมที่ไม่สามารถคอมไพล์โปรเจ็กต์ Go ควรคาดหวังถึงความยุ่งยากในการตั้งค่า ผู้ใช้ควรตรวจสอบข้อความที่ถูกดึงมาก่อนที่จะใช้เป็นข้อมูลนำเข้าของโมเดลที่เชื่อถือได้