คู่มือฉบับสมบูรณ์สำหรับการตรวจสอบเซิร์ฟเวอร์ด้วย Grafana และ Prometheus

การปรับปรุงครั้งล่าสุด: 29 2026 สิงหาคม
  • การนำระบบนิเวศการตรวจสอบมาใช้โดยอาศัยการรวบรวมตัวชี้วัดเชิงเวลาและการแสดงผลในรูปแบบกราฟิก
  • การติดตั้งเอเจนต์ส่งออกเฉพาะสำหรับสภาพแวดล้อม GNU/Linux และ Windows เพื่อดึงข้อมูลระบบ
  • กลยุทธ์การขยายขนาดขั้นสูงโดยใช้ Thanos และ VictoriaMetrics สำหรับการจัดเก็บข้อมูลขนาดใหญ่

วิศวกรระบบควบคุมดูแลโครงสร้างพื้นฐานเซิร์ฟเวอร์ในศูนย์ข้อมูลที่ทันสมัย

ในปัจจุบัน การติดตามความเคลื่อนไหวภายในโครงสร้างพื้นฐานทางเทคโนโลยีของเราไม่ใช่เรื่องฟุ่มเฟือย แต่เป็นสิ่งจำเป็นอย่างยิ่ง การตรวจสอบระบบอย่างต่อเนื่อง สิ่งนี้ช่วยให้เราคาดการณ์ปัญหาได้ก่อนที่ผู้ใช้ปลายทางจะสังเกตเห็นว่ามีบางอย่างผิดปกติ ป้องกันไม่ให้ข้อผิดพลาดเล็กน้อยลุกลามกลายเป็นปัญหาบริการล่มทั้งหมดที่ทำให้เรานอนไม่หลับ

เพื่อให้บรรลุเป้าหมายนี้ จึงได้มีการสร้างส่วนผสมที่ลงตัวขึ้นมา นั่นคือ Prometheus และ Grafana โดย Prometheus รับผิดชอบด้านต่างๆ รวบรวมและจัดเก็บข้อมูลตัวชี้วัด ในฐานข้อมูลอนุกรมเวลา ตัวที่สองนี้มอบอินเทอร์เฟซภาพที่มีประสิทธิภาพ ทำให้เราสามารถแปลงตัวเลขเหล่านั้นเป็นกราฟที่ทุกคนสามารถเข้าใจได้ในทันที

แนวทางปฏิบัติที่ดีที่สุดสำหรับการตรวจสอบเซิร์ฟเวอร์
บทความที่เกี่ยวข้อง:
การตรวจสอบเซิร์ฟเวอร์: แนวทางปฏิบัติที่ดีที่สุดเพื่อสภาพแวดล้อมที่เชื่อถือได้

หลักการพื้นฐานของการตรวจสอบแบบครบวงจร

รายละเอียดฮาร์ดแวร์ของเซิร์ฟเวอร์ระดับองค์กรในตู้แร็คศูนย์ข้อมูล

เมื่อเราพูดถึงการตรวจสอบเชิงรุก เราหมายถึงการไม่รอให้เซิร์ฟเวอร์ล่มก่อนจึงค่อยดำเนินการ แนวทางนี้... การตรวจสอบ APM (การจัดการประสิทธิภาพแอปพลิเคชัน) เทคโนโลยีนี้ช่วยให้คุณสังเกตเส้นทางทั้งหมดของการร้องขอ ตรวจจับจุดคอขวดหรือข้อผิดพลาดด้านประสิทธิภาพได้แบบเรียลไทม์ ซึ่งมีความสำคัญอย่างยิ่ง เพราะในอดีต เราเปลี่ยนจากการตรวจสอบตัวบ่งชี้ทางกายภาพด้วยตนเองในช่วงทศวรรษ 80 มาเป็นการใช้เครื่องมืออัตโนมัติที่ช่วยให้เราตรวจสอบได้ในปัจจุบัน วิสัยทัศน์ที่ครอบคลุมเกี่ยวกับโครงสร้างพื้นฐาน.

  Asterisk คืออะไร: IP PBX โอเพนซอร์สที่อธิบายได้

การนำระบบตรวจสอบประเภทนี้มาใช้ไม่เพียงแต่ช่วยลดเวลาหยุดทำงาน แต่ยังช่วยเพิ่มประสิทธิภาพต้นทุนการดำเนินงานอีกด้วย ยิ่งไปกว่านั้น หากเราต้องการให้ทุกอย่างดำเนินไปอย่างราบรื่น การเพิ่มระบบตรวจสอบที่เหมาะสมจึงเป็นสิ่งจำเป็น การจัดการ API ที่มีประสิทธิภาพการทำให้มั่นใจว่าการสื่อสารระหว่างแอปพลิเคชันนั้นสามารถปรับขนาดได้และปลอดภัย จึงเป็นการเสริมกลยุทธ์การตรวจสอบให้สมบูรณ์

ตู้แร็คเซิร์ฟเวอร์ที่มีป้ายกำกับ NETWORK-2 ในศูนย์ข้อมูลที่มีไฟสีฟ้า
บทความที่เกี่ยวข้อง:
ผลกระทบทางเศรษฐกิจและการดำเนินงานจากการหยุดทำงานของเครือข่าย

การสร้างระบบ: Prometheus และ Grafana บน Linux

โปรแกรมเมอร์กำลังตั้งค่าเซิร์ฟเวอร์ Linux โดยใช้เทอร์มินัลพร้อมข้อมูลเมตริกของระบบ

ในการนำระบบนี้ไปใช้ในสภาพแวดล้อมลินุกซ์ เราต้องการส่วนประกอบสำคัญสามส่วน ส่วนแรกคือ... โปรมีธีอุส-โหนด-เอ็กซ์พอร์ตเตอร์ซึ่งมีหน้าที่ในการเผยแพร่ข้อมูลเมตริกของระบบบนพอร์ต 9100 รายละเอียดที่สำคัญคือ ในบางดิสทริบิวชัน เช่น Ubuntu ตัวเก็บรวบรวมข้อมูล systemd อาจสร้างข้อมูลมากเกินไป (high cardinality) ดังนั้นบางครั้งจึงแนะนำให้... ปิดใช้งานตัวเก็บรวบรวมบางตัว ใช้ Ansible เพื่อหลีกเลี่ยงการโอเวอร์โหลดระบบ โดยทำตามขั้นตอนต่อไปนี้ คู่มือฉบับสมบูรณ์สำหรับการเพิ่มประสิทธิภาพเซิร์ฟเวอร์ Linux.

ขั้นตอนต่อไปคือเซิร์ฟเวอร์ Prometheus ซึ่งเราจะทำการกำหนดค่าไฟล์ prometheus.ymlตรงนี้แหละที่เราจะบอกคุณอย่างละเอียด ควรตรวจสอบอุปกรณ์ใดบ้าง การกำหนด scrape_configs และเป้าหมาย (IP และพอร์ต) เมื่อ Prometheus เริ่มเก็บข้อมูลทุกๆ สองสามวินาที Grafana ก็จะเข้ามามีบทบาท เครื่องมือนี้มักติดตั้งโดยใช้แพ็กเกจ .deb และช่วยให้เราสามารถ เชื่อมต่อ Prometheus เป็นแหล่งข้อมูล จากนั้นจึงนำเข้าแดชบอร์ดที่ออกแบบไว้ล่วงหน้า ซึ่งช่วยประหยัดเวลาในการสร้างแผนภูมิแต่ละรายการตั้งแต่เริ่มต้น

ผู้ดูแลระบบกำลังตรวจสอบกระบวนการแบบเรียลไทม์ในเทอร์มินัล Linux แบบหลายหน้าต่าง
บทความที่เกี่ยวข้อง:
คู่มือฉบับสมบูรณ์เกี่ยวกับการตรวจสอบทรัพยากรใน Linux: ตั้งแต่ต้นจนจบ

ทางเลือกที่รวดเร็วด้วย Docker Compose

การใช้สมาร์ทโฟนเพื่อตรวจสอบระยะไกลและรับการแจ้งเตือนเครือข่ายในศูนย์ข้อมูล

หากคุณไม่ต้องการจัดการกับการติดตั้งด้วยตนเอง คุณสามารถตั้งค่าสภาพแวดล้อมทั้งหมดโดยใช้คอนเทนเนอร์ได้ โดยใช้ไฟล์ นักเทียบท่า-compose.ymlเราสามารถจัดการอิมเมจ Prometheus, อิมเมจ Grafana และ Node Exporter บนเครือข่ายเสมือนเดียวกันได้ เพื่อป้องกันการสูญเสียข้อมูลเมื่อคอนเทนเนอร์รีสตาร์ท จำเป็นอย่างยิ่งที่จะต้องกำหนดค่าให้ถูกต้อง ปริมาณความคงทน ในระบบไฟล์ของโฮสต์

  ประเภทกราฟที่จำเป็น: คู่มือฉบับสมบูรณ์

ในรูปแบบนี้ การกำหนดค่าจะง่ายขึ้นมาก เราสามารถใช้ไฟล์ YAML เพื่อ... การจัดเตรียมแหล่งข้อมูล Grafana โดยอัตโนมัติ ไม่จำเป็นต้องเข้าถึงเว็บอินเทอร์เฟซเพื่อกำหนดค่า URL ของ Prometheus นอกจากนี้ สำหรับผู้ใช้ขั้นสูง ยังมีตัวเลือกในไฟล์ JSON การกำหนดค่าที่อนุญาตให้เปลี่ยนวิธีการสืบค้นเป็น POST หรือจัดการ การแจ้งเตือนโดยตรงจาก Grafana.

ขยายการตรวจสอบไปยังสภาพแวดล้อม Windows

ภาพตู้เซิร์ฟเวอร์ที่ส่องสว่างด้วยแสงสีฟ้า แสดงถึงความสามารถในการขยายขนาดของโครงสร้างพื้นฐานทางเทคโนโลยี

Linux ไม่ใช่ทุกสิ่งทุกอย่างในโลกธุรกิจ Windows ยังคงเป็นระบบปฏิบัติการหลักในศูนย์ข้อมูลหลายแห่ง เพื่อที่จะบูรณาการระบบเหล่านี้เข้าด้วยกัน เซิร์ฟเวอร์เฉพาะระบบ Windows, เราใช้ ส่งออกหน้าต่างซึ่งจะแสดงเมตริกบนพอร์ต 9182 กระบวนการจะคล้ายกัน คือ เราติดตั้งเอเจนต์บนเครื่อง Windows เพิ่มงานที่เกี่ยวข้องใน Prometheus และค้นหา แดชบอร์ดเฉพาะสำหรับ Windows (เช่น ID 14694 ในแกลเลอรี Grafana) เพื่อดูสถานะของ CPU หน่วยความจำ และดิสก์

แป้นพิมพ์เรียงกันเป็นคำว่า PASSWORD บนพื้นหลังสีปะการัง - แนวคิดเกี่ยวกับรหัสผ่าน
บทความที่เกี่ยวข้อง:
คู่มือฉบับสมบูรณ์เกี่ยวกับการจัดการรหัสผ่านสำหรับธุรกิจ

โซลูชันสำหรับการจัดเก็บข้อมูลจำนวนมากและความสามารถในการขยายขนาด

เมื่อบริษัทเติบโตขึ้นและเริ่มจัดการตัวชี้วัดนับล้านรายการ Prometheus อาจเริ่มทำงานได้ไม่ดี เพื่อแก้ไขปัญหานี้ จึงมีเครื่องมือต่างๆ เช่น [ชื่อเครื่องมือหายไป] ธานอสซึ่งช่วยให้สามารถย้ายข้อมูลไปยังที่เก็บข้อมูลบนคลาวด์ เช่น AWS S3 หรือ Google Cloud Storage ได้ จึงเป็นการให้บริการ ความพร้อมใช้งานสูงและการรักษาลูกค้าในระยะยาวThanos ใช้ Sidecar ที่มาพร้อมกับ Prometheus และคอมโพเนนต์ Query เพื่อทำการค้นหาข้อมูลแบบรวมศูนย์

ทางเลือกอันทรงพลังอีกทางหนึ่งคือ วิคตอเรียเมตริกส์โซลูชันนี้มีประสิทธิภาพสูงเป็นพิเศษในการใช้ CPU และหน่วยความจำ สามารถนำไปใช้ในสถาปัตยกรรมที่ซับซ้อนได้ Prometheus-Operator บน Kubernetes เพื่อจัดการการเก็บรวบรวมข้อมูลในพื้นที่และส่งข้อมูลเมตริกทั้งหมดไปยังคลัสเตอร์ VictoriaMetrics ในภายหลัง ระบบนี้แบ่งออกเป็นส่วนประกอบต่างๆ เช่น vmstorage เพื่อบันทึกข้อมูล vminsert เพื่อเขียนและ vmselect เพื่อการปรึกษาหารือ ช่วยให้ฝ่ายบริหารสามารถดำเนินการได้ จุดข้อมูลหลายพันล้านจุด โดยที่ระบบไม่ช้าลง

  การวิเคราะห์บันทึกข้อมูล: คู่มือฉบับสมบูรณ์สำหรับไอที ความปลอดภัย และ SEO

การเลือกใช้เครื่องมือใดเครื่องมือหนึ่งนั้นมักขึ้นอยู่กับปริมาณข้อมูล แม้ว่า Prometheus จะเหมาะสำหรับระยะสั้น แต่การใช้งานร่วมกับเครื่องมืออื่นๆ ก็อาจไม่เหมาะสม VictoriaMetrics หรือ Thanos เป็นตัวเลือกที่ปลอดภัยสำหรับสภาพแวดล้อมมัลติคลาวด์ที่จำเป็นต้องรวมศูนย์ข้อมูลจากคลัสเตอร์หลายสิบแห่งและรับประกันว่า การรับส่งข้อมูลจะถูกเข้ารหัสเสมอ และยืนยันตัวตนโดยใช้พร็อกซีรักษาความปลอดภัย

การนำระบบนิเวศที่ใช้ Prometheus และ Grafana มาเสริมด้วยเอเจนต์สำหรับ Linux และ Windows และปรับขนาดโดยใช้ VictoriaMetrics หรือ Thanos จะเปลี่ยนการจัดการด้านไอทีให้เป็นกระบวนการที่คาดการณ์ได้และมีประสิทธิภาพ ด้วยการรวมศูนย์ตัวชี้วัดและการแจ้งเตือนอัตโนมัติ องค์กรจะมองเห็นภาพรวมของโครงสร้างพื้นฐานได้อย่างสมบูรณ์ ปรับปรุงประสิทธิภาพ และสร้างความต่อเนื่องทางธุรกิจในกรณีที่เกิดปัญหาทางเทคนิคที่ไม่คาดฝัน

เราเตอร์ไร้สายรุ่นใหม่พร้อมไฟ LED คือหัวใจสำคัญของเครือข่ายภายในบ้าน
บทความที่เกี่ยวข้อง:
คู่มือฉบับสมบูรณ์สำหรับการตรวจสอบเครือข่าย: เครื่องมือและกลยุทธ์