จุดสำคัญ
- ใช้เอนด์พอยต์ /v1/chat/completions เพื่อให้แน่ใจว่าเข้ากันได้กับ SDK ที่มีอยู่และทำให้การผสานรวมง่ายขึ้น
- ตรวจสอบหน้าต่างบริบท 100k โทเคนอย่างเข้มงวดเพื่อหลีกเลี่ยงการตัดทอนก่อนกำหนดหรือต้นทุนที่ไม่คาดคิด
- ดำเนินการจัดการข้อผิดพลาดที่แข็งแกร่งเพื่อจัดการกับขีดจำกัดอัตรา (RPM) และความแปรปรวนของความหน่วงเวลาแบบไม่เซ็นเซอร์
- โปรดจำไว้ว่าการไม่มีตัวกรองหมายความว่าคุณเป็นผู้รับผิดชอบในการตรวจสอบเนื้อหาต่อหากจำเป็น
การกำหนดโมเดล
การเลือกโมเดลกำหนดพฤติกรรมของแอปพลิเคชัน สำหรับการใช้งาน AI แบบไม่เซ็นเซอร์ ให้เลือกโมเดลแบบเปิดน้ำหนัก (open-weight) ที่ฝึกมาเพื่อลดการปฏิเสธในหัวข้อผู้ใหญ่หรือข้อโต้แย้ง ต่างจากโมเดลปิดทั่วไป โมเดล LLM ประเภทนี้ไม่ใช้ guardrail ที่เข้มงวดตามนโยบายบริษัท ทำให้คำตอบตรงตามพรอมต์ของผู้ใช้มากกว่า
ตรวจสอบว่าโมเดลรองรับการเรียกใช้ฟังก์ชัน (tool calling) โดยตรงหรือไม่ สิ่งนี้สำคัญมากสำหรับแอปพลิเคชันที่ต้องการจัดโครงสร้างผลลัพธ์ JSON หรือโต้ตอบกับ API ภายนอก ความเข้ากันได้กับรูปแบบ payload ของ API OpenAI รับประกันว่าคุณสามารถเปลี่ยนผู้ให้บริการได้โดยไม่ต้องเขียนชั้นการผสานรวมใหม่
การตรวจสอบบริบท
หน้าต่างบริบทขนาด 100,000 โทเคนช่วยให้รักษาการสนทนาที่ยาวนานหรือประมวลผลเอกสารขนาดใหญ่ได้โดยไม่สูญเสียข้อมูลทันที อย่างไรก็ตาม บริบทที่ใหญ่กว่าไม่ได้หมายถึงความฉลาดที่สูงกว่า แต่หมายถึงหน่วยความจำที่ขยายใหญ่ขึ้น นักพัฒนาควรใช้กลยุทธ์ sliding window หรือการสรุปข้อความเพื่อจัดการประวัติที่เพิ่มขึ้น
- Input Tokens: นับประวัติการสนทนาและพรอมต์ปัจจุบัน
- Output Tokens: นับคำตอบที่สร้าง
ตรวจสอบการใช้โทเคนแบบเรียลไทม์ การเกินขีดจำกัด 100k จะทำให้เกิดข้อผิดพลาด API หรือการตัดทอน ขึ้นอยู่กับการดำเนินการของเซิร์ฟเวอร์ สำหรับแอปพลิเคชันแชทที่ยาวนาน ให้พิจารณาส่งเฉพาะการโต้ตอบ N ล่าสุดเพื่อรักษาต้นทุนที่คาดการณ์ได้
การจัดการโทเคน
ต้นทุนของ AI แบบไม่เซ็นเซอร์แปรผันตามปริมาณโทเคนที่ประมวลผล โมเดลคิด $0.25 ต่อล้านโทเคนอินพุต และ $1.00 ต่อล้านโทเคนเอาต์พุต เนื่องจากเอาต์พุตมักยาวและซับซ้อนกว่าในโมเดลไร้ตัวกรอง ต้นทุนเอาต์พุตจึงอาจสูงกว่าอินพุตอย่างมีนัยสำคัญ
ดำเนินการตัวนับโทเคนที่ฝั่งไคลเอนต์ก่อนส่งคำขอ สิ่งนี้ทำให้สามารถประมาณต้นทุนที่แน่นอนของคำตอบก่อนการส่งได้ เพื่อการเพิ่มประสิทธิภาพ ให้ลดความ verbose ของพรอมต์ระบบและใช้ฟังก์ชันเพื่อส่งคืนข้อมูลที่มีโครงสร้างแทนข้อความธรรมชาติ whenever เป็นไปได้ เนื่องจาก JSON มีความหนาแน่นของโทเคนมากกว่าภาษาธรรมชาติ
ขีดจำกัดคำขอ
เพื่อให้มั่นใจในความเสถียร บริการจะกำหนดขีดจำกัดอัตรา 300 คำขอต่อนาที (RPM) ต่อคีย์ API และขนาดเนื้อหาคำขอสูงสุด 8 MB เมื่อมีการใช้งานเพิ่มขึ้น การเกินขีดจำกัด RPM จะทำให้เกิดข้อผิดพลาด 429 (Too Many Requests) นักพัฒนาควรนำการเรียกซ้ำแบบ backoff แบบเอกซ์โพเนนเชียลไปใช้
พิจารณาการใช้คิวข้อความเพื่อปรับความต้องการให้เรียบในแอปพลิเคชันที่มีความพร้อมกันสูง หากคุณต้องการปริมาณการส่งข้อมูลที่สูงขึ้น ให้วางแผนการกระจายโหลดระหว่างคีย์ API หลายรายการหรือเพิ่มความหน่วงเวลาที่ผู้ใช้รู้สึกเพื่อให้เคารพขีดจำกัดตามธรรมชาติของโครงสร้างพื้นฐาน
ความปลอดภัยของคีย์ API
คีย์ API ของคุณเป็นข้อมูลประจำตัวเดียวสำหรับการเข้าถึง AI ไม่เซ็นเซอร์ มันไม่หมดอายุโดยอัตโนมัติ แต่สามารถเพิกถอนได้ตลอดเวลา เก็บคีย์ไว้ในตัวแปรสภาพแวดล้อมบนเซิร์ฟเวอร์และอย่าเปิดเผยในโค้ดส่วนหน้าหรือในที่เก็บสาธารณะ
หากมีการสงสัยว่ามีการใช้งานในทางที่ผิด ให้สร้างคีย์ใหม่ทันที สิ่งนี้จะทำให้คีย์เก่าไม่ถูกต้องและตัดการเข้าถึงของลูกค้าที่ใช้อยู่ทั้งหมด เปิดใช้งานการแจ้งเตือนการใช้งานเกินหากแพลตฟอร์มของคุณอนุญาตให้ตรวจสอบรายละเอียด เพื่อตรวจจับบอทหรือสคริปต์ที่รั่วไหลได้อย่างรวดเร็ว
การจัดการข้อผิดพลาด
ข้อผิดพลาดทั่วไปรวมถึง 429 Too Many Requests (ขีดจำกัดอัตรา), 400 Bad Request (รูปแบบไม่ถูกต้อง) และ 500 Internal Server Error ควรจัดการข้อผิดพลาดเครือข่ายและ timeout เสมอ โมเดลแบบไม่เซ็นเซอร์อาจ ocasionalmente ส่งกลับคำตอบที่ไม่สมบูรณ์หรือการเกิด hallucination บ่อยขึ้นเนื่องจากข้อมูลการฝึกฝนที่มีการคัดกรองน้อยกว่า
นำตรรกะ fallback ไปใช้ หากคำตอบล้มเหลว ให้ลองอีกครั้งด้วย temperature ที่แตกต่างกันเล็กน้อยหรือลดขนาดหน้าต่างบริบท การแสดงข้อผิดพลาดทางเทคนิคดิบให้ผู้ใช้ปลายทางอาจทำให้สับสน; ควรแปลงรหัสข้อผิดพลาดเป็นข้อความที่ใช้งานง่ายเสมอ
สตรีมมิงและเวลาจริง
การรองรับ Streaming Server-Sent Events (SSE) ช่วยให้คุณสามารถแสดงคำตอบโทเคนต่อโทเคน ซึ่งปรับปรุงการรับรู้ความหน่วงเวลาสำหรับผู้ใช้ สิ่งนี้จำเป็นสำหรับแอปพลิเคชันแชทแบบเรียลไทม์
เพื่อใช้งานสตรีมมิง ให้กำหนดค่าไคลเอนต์ HTTP ของคุณเพื่ออ่านชิ้นส่วนของข้อมูลเมื่อมาถึง สิ่งนี้ลดเวลาการรอเริ่มต้น (TTFT) ที่รู้สึกได้ โปรดจัดการสถานะของไคลเอนต์เพื่อหลีกเลี่ยงการทำซ้ำของโทเคนหากการเชื่อมต่อขาดและต้องเชื่อมต่อใหม่ สตรีมมิงไม่เปลี่ยนราคาที่ต้องชำระ เพียงเปลี่ยนวิธีการส่งข้อมูล
การใช้งานฟังก์ชัน
ฟังก์ชัน (function calling) อนุญาตให้โมเดลตัดสินใจเมื่อใดและอย่างไรที่จะเรียกใช้เครื่องมือภายนอก ด้วย API ไม่จำกัด โมเดลอาจมีความคิดสร้างสรรค์มากขึ้นในการจัดโครงสร้างอาร์กิวเมนต์ของฟังก์ชัน ตรวจสอบให้แน่ใจว่าได้ตรวจสอบพารามิเตอร์ที่ได้รับที่ฝั่งเซิร์ฟเวอร์ก่อนดำเนินการ
กำหนดสคีมา JSON ที่ชัดเจนสำหรับฟังก์ชันของคุณ การไม่มีเซ็นเซอร์ไม่ส่งผลต่อความถูกต้องทางเทคนิคของ JSON แต่อาจส่งผลต่อความคิดสร้างสรรค์ของโมเดลในการตีความบริบทที่คลุมเครือ ทดสอบกรณีขอบเขตที่โมเดลอาจสร้างอาร์กิวเมนต์ที่ไม่ได้กำหนดในสคีมาอย่างกว้างขวาง
ความเป็นส่วนตัวของข้อมูล
แม้ว่าโมเดลจะไม่กรองเนื้อหา โปรดตรวจสอบนโยบายการใช้ข้อมูลสำหรับการฝึกโมเดล บริการนี้ระบุว่าพรอมต์ไม่ถูกนำไปใช้ในการฝึกโมเดล ซึ่งสำคัญมากสำหรับแอปพลิเคชันระดับองค์กรหรือข้อมูลที่อ่อนไหว ความเป็นส่วนตัวได้รับการรับประกันจากความเรียบง่ายของบริการ: ใช้เฉพาะอีเมลและรหัสผ่านในการสร้างบัญชี
สำหรับข้อมูลที่มีความอ่อนไหวสูง ให้พิจารณาใช้ชั้นการบดบังข้อมูลก่อนส่งไปยัง API หากความเป็นส่วนตัวเป็นปัจจัยสำคัญ โปรดจำไว้ว่าโมเดลจะสร้างข้อความตามพรอมต์ที่ส่งไป หากคุณส่งชื่อไป ชื่ออาจปรากฏในคำตอบ การไม่มีระบบเซ็นเซอร์หมายความว่าโมเดลจะไม่บล็อกข้อมูลระบุตัวตนส่วนบุคคล (PII) โดยอัตโนมัติ