NVIDIA PAIR หรือ Personal AI Router รุ่น Beta เป็นซอฟต์แวร์รับคำขอ AI จุดเดียว แล้วส่งงานไปยังคอมเครื่องอื่นในเครือข่ายบ้านเดียวกันที่พร้อม มีโมเดลนั้นอยู่ และภาระงานยังไม่แน่น รองรับ Ollama กับ LM Studio บน Windows, Linux และ macOS โดยไม่ต้องแก้ตัว Agent ให้พูดภาษาคลัสเตอร์ใหม่
NVIDIA PAIR ส่งงานทีละคำขอ ไม่รวมการ์ดจอ
บริษัทระบุว่าตัวนี้ช่วยลดคิวเมื่อมีคำขอเข้ามาพร้อมกัน แต่ไม่ได้รวม GPU หรือ VRAM หลายเครื่องให้กลายเป็นการ์ดจอใหญ่ใบเดียว และไม่แบ่งโมเดลเดียวข้ามเครื่อง แต่ละเครื่องยังต้องโหลดโมเดลและรันคำขอนั้นได้เอง งานหลาย Agent จึงถูกยกเป็นตัวอย่าง เพราะมีหลายคำขออิสระให้กระจายไปคนละเครื่อง ไม่ใช่คำขอเดียวที่ถูกฉีกไปหลายการ์ด
เครื่องที่จับคู่ได้และสิ่งที่ต้องมีในเครื่องนั้น
ชุดที่รองรับในเบตานี้ครอบคลุมระบบที่มี GeForce RTX ซีรีส์ 20 ขึ้นไป, RTX PRO สถาปัตยกรรม Turing ขึ้นไป, DGX Spark และชิป Apple M4 ขึ้นไป ผสมวินโดวส์ ลินุกซ์ และแมคในคลัสเตอร์เดียวกันได้ การค้นหาเครื่องใช้เครือข่ายท้องถิ่น และการจับคู่มีรหัสยืนยันก่อนสื่อสารแบบเข้ารหัส ตัวโปรแกรมเป็นเบตาฟรีและเปิดซอร์ส ไม่มีป้ายราคาไทยเพราะไม่ใช่กล่องฮาร์ดแวร์ที่ต้องสั่งผ่านร้าน
บ้านที่มีคอมว่างหลายเครื่องและรันงานหลายคำขอพร้อมกันจะได้ประโยชน์จากคิวที่แตกได้ คนที่หวังยัดโมเดลใหญ่ใบเดียวให้กิน VRAM ข้ามเครื่องจะไม่ได้อะไรจากชุดนี้ เพราะ ฟีเจอร์นี้ ไม่ทำหน้าที่นั้น ต้องมีเอนจินกับไฟล์โมเดลในเครื่องที่จะรับงานจริง ไม่ใช่แค่ติดตั้งเราเตอร์แล้วเครื่องอื่นยืมความจำการ์ดจอมาใช้ แอปที่ชี้ไปยังที่อยู่ท้องถิ่นแบบเดียวกับ Ollama หรือ LM Studio อยู่แล้วจึงไม่ต้องย้ายไป API คลัสเตอร์ชุดใหม่ คนที่บ้านมีโน้ตบุ๊กแมคกับพีซีการ์ดจอว่างช่วงกลางคืนจะเข้ากับมุมนี้มากกว่าคนที่มีเครื่องเดียวแล้วอยากให้โมเดลใหญ่ขึ้นโดยไม่เพิ่มการ์ด
บ้านนี้จะกระจายงานหลายเครื่อง หรือยังรันเครื่องเดียวอยู่?
ที่มา: NVIDIA
หลักการทำงานของ Personal AI Router
ซอฟต์แวร์นี้เชื่อมคอมพิวเตอร์ที่รองรับบนเครือข่ายภายในบ้าน แล้วเปิดจุดเชื่อมต่อเดียวให้แอป AI ส่งคำขอเข้ามา ระบบจะเลือกเครื่องที่พร้อมทำงานตามเอนจิน โมเดล และภาระงานในขณะนั้น จึงช่วยใช้พลังประมวลผลที่ว่างกับงาน local inference ได้สะดวกขึ้น
แนวทางนี้ไม่ได้รวมหน่วยความจำ GPU ของหลายเครื่องให้กลายเป็นก้อนเดียว และไม่ได้แบ่งโมเดลหนึ่งตัวให้ประมวลผลข้ามหลายเครื่อง แต่จะส่งคำขอแต่ละรายการไปยังโหนดที่เหมาะสม เหมาะกับงานที่มีคำขอหลายรายการพร้อมกัน เช่น แอปหรือเอเจนต์ AI ที่ทำงานแบบขนาน
รุ่นเบตารองรับ Ollama และ LM Studio พร้อมใช้งานผ่านหน้าต่างเดสก์ท็อปหรือคำสั่งบนเทอร์มินัล อุปกรณ์ที่ประกาศรองรับมีทั้ง Windows, Linux, macOS, GeForce RTX 20 Series ขึ้นไป, RTX PRO บนสถาปัตยกรรม Turing ขึ้นไป, DGX Spark และ Mac ที่ใช้ชิป M4 หรือใหม่กว่า
การประมวลผลทำงานภายในเครือข่าย ทำให้พรอมต์ ไฟล์ และบริบทของเอเจนต์ไม่จำเป็นต้องส่งขึ้นคลาวด์ อินเทอร์เน็ตยังต้องใช้สำหรับดาวน์โหลดโมเดล แต่การใช้งานตามปกติทำได้โดยไม่ต้องเชื่อมต่อภายนอก ทั้งนี้ควรตรวจสอบข้อกำหนดระบบล่าสุดก่อนติดตั้ง เพราะฮาร์ดแวร์และเวอร์ชันระบบปฏิบัติการที่รองรับอาจเปลี่ยนได้
อ่านต่อ: บทวิเคราะห์เทคโนโลยีและ AI










