क्या है RAG Pipeline Cost Calculator?
▾
आरएजी पाइपलाइन लागत कैलकुलेटर चार लागत घटकों को मिलाकर एक पुनर्प्राप्ति-संवर्धित पीढ़ी प्रणाली को चलाने के कुल मासिक खर्च का अनुमान लगाता है: एम्बेडिंग पीढ़ी, वेक्टर डेटाबेस होस्टिंग, दस्तावेज़ पुनर्प्राप्ति प्रश्न और प्रतिक्रिया पीढ़ी के लिए एलएलएम अनुमान। आरएजी पाइपलाइन उत्तर उत्पन्न करने से पहले प्रासंगिक दस्तावेजों को पुनर्प्राप्त करके, मतिभ्रम को नाटकीय रूप से कम करके और डोमेन-विशिष्ट अनुप्रयोगों के लिए सटीकता में सुधार करके आपके मालिकाना डेटा में एलएलएम प्रतिक्रियाओं को ग्राउंड करती है। यह कैलकुलेटर ज्ञान आधार, ग्राहक सहायता प्रणाली, आंतरिक खोज उपकरण और किसी भी एप्लिकेशन का निर्माण करने वाली इंजीनियरिंग टीमों के लिए आवश्यक है, जिन्हें विशिष्ट दस्तावेजों या डेटा के बारे में सवालों के जवाब देने के लिए एलएलएम की आवश्यकता होती है। 100,000-दस्तावेज़ कॉर्पस के साथ प्रति माह 10,000 प्रश्नों की सेवा देने वाली एक सामान्य आरएजी पाइपलाइन की लागत घटक विकल्पों के आधार पर $150 से $500 प्रति माह हो सकती है, जिससे आर्किटेक्चर के लिए प्रतिबद्ध होने से पहले मॉडल लागत को महत्वपूर्ण बना दिया जाता है। चार लागत घटकों में बहुत भिन्न स्केलिंग विशेषताएँ हैं। एंबेडिंग मुख्य रूप से एक बार की लागत है जो केवल दस्तावेज़ अपडेट के लिए दोहराई जाती है। वेक्टर डेटाबेस होस्टिंग एक निश्चित मासिक व्यय है जो कॉर्पस आकार के साथ बढ़ता है। पुनर्प्राप्ति क्वेरी लागत क्वेरी मात्रा के साथ रैखिक रूप से मापी जाती है। और एलएलएम अनुमान, आम तौर पर कुल लागत का 60 से 80 प्रतिशत पर सबसे बड़ा घटक, क्वेरी वॉल्यूम और मॉडल को पारित किए गए पुनर्प्राप्त संदर्भ की मात्रा दोनों के साथ स्केल करता है। इन गतिशीलता को समझने से टीमों को सबसे प्रभावशाली लागत चालकों को अनुकूलित करने में मदद मिलती है।
Calkulon makes complex calculations simple — built for students and everyday problem-solvers.
सूत्र
▾
कुल मासिक आरएजी लागत = एम्बेडिंग लागत + वेक्टर डीबी मासिक लागत + (प्रति माह प्रश्न x पुनर्प्राप्ति लागत प्रति प्रश्न) + (प्रति माह प्रश्न x एलएलएम लागत प्रति प्रश्न)। 100K दस्तावेज़ों, 20K मासिक प्रश्नों वाले सिस्टम के लिए, टेक्स्ट-एम्बेडिंग-3-स्मॉल, पाइनकोन और GPT-4o का उपयोग करते हुए: एंबेडिंग = $1.00 (एकमुश्त, परिशोधन)। वेक्टर डीबी = $70/माह। पुनर्प्राप्ति = नगण्य. एलएलएम = 20,000 x (3,000 इनपुट टोकन x $2.50/1एम + 500 आउटपुट टोकन x $10/1एम) = $250.00। कुल = लगभग $321 प्रति माह।चर विवरण
▾
| प्रतीक | नाम | इकाई | विवरण |
|---|---|---|---|
| D | दस्तावेज़ कॉर्पस का आकार | documents | वेक्टर डेटाबेस में संग्रहीत पाठ दस्तावेज़ों या टुकड़ों की कुल संख्या, जो एम्बेडिंग लागत और वेक्टर भंडारण आवश्यकताओं को निर्धारित करती है। |
| T_chunk | प्रति टुकड़ा टोकन | tokens | प्रति दस्तावेज़ खंड की औसत टोकन संख्या, आरएजी सिस्टम में इष्टतम पुनर्प्राप्ति ग्रैन्युलैरिटी के लिए आमतौर पर 256 से 512 टोकन। |
| K | प्रति क्वेरी के अनुसार टुकड़े पुनर्प्राप्त किए गए | chunks | प्रत्येक उपयोगकर्ता क्वेरी के लिए वेक्टर डेटाबेस से प्राप्त समान दस्तावेज़ खंडों की संख्या, आमतौर पर प्रश्नों की जटिलता के आधार पर 3 से 8 तक। |
| Q | मासिक क्वेरी वॉल्यूम | queries per month | प्रत्येक माह आरएजी पाइपलाइन द्वारा संसाधित उपयोगकर्ता प्रश्नों की कुल संख्या, जो पुनर्प्राप्ति और एलएलएम अनुमान लागत दोनों को बढ़ाती है। |
| C_vdb | वेक्टर डीबी मासिक लागत | USD per month | वेक्टर डेटाबेस सेवा के लिए निश्चित या उपयोग-आधारित मासिक होस्टिंग लागत, सर्वर रहित के लिए $10 से लेकर समर्पित पॉड्स के लिए $200 या अधिक तक। |
| C_llm | एलएलएम लागत प्रति प्रश्न | USD per query | पुनर्प्राप्त संदर्भ को संसाधित करने और प्रतिक्रिया उत्पन्न करने के लिए भाषा मॉडल के लिए अनुमान लागत, आमतौर पर $0.005 से $0.05 प्रति क्वेरी पर सबसे बड़ा एकल लागत घटक। |
कैसे RAG Pipeline Cost Calculator
▾
- 1अपने दस्तावेज़ कोष के लिए एम्बेडिंग लागत की गणना करें। दस्तावेज़ों की कुल संख्या, विभाजन के बाद प्रति टुकड़े औसत टोकन और टुकड़ों के बीच कोई ओवरलैप निर्धारित करें। $0.02 प्रति मिलियन टोकन पर टेक्स्ट-एम्बेडिंग-3-स्मॉल का उपयोग करते हुए, 15 प्रतिशत ओवरलैप के साथ 400 टोकन पर 100,000 दस्तावेज़ों का एक संग्रह प्रारंभिक एम्बेडिंग के लिए लगभग $0.92 खर्च करता है। यह महीनों में चुकाई जाने वाली एकमुश्त लागत है, जिसमें केवल नए या अद्यतन दस्तावेज़ों के लिए वृद्धिशील लागत शामिल है।
- 2अपने वेक्टर डेटाबेस होस्टिंग लागत का अनुमान लगाएं। पाइनकोन सर्वर रहित शुल्क पढ़ने वाली इकाइयों, लिखने वाली इकाइयों और भंडारण पर आधारित है। 1536 आयामों वाले 100,000 वैक्टरों के एक संग्रह के लिए लगभग 600 एमबी भंडारण की आवश्यकता होती है। पाइनकोन पॉड-आधारित योजनाएं एक एस1 पॉड के लिए $70 प्रति माह से शुरू होती हैं। छोटे समूहों के लिए वीवेट क्लाउड $25 प्रति माह से शुरू होता है। $50 से $150 प्रति माह वीएम पर स्व-होस्टेड पीजीवेक्टर छोटी तैनाती के लिए सबसे किफायती विकल्प है।
- 3प्रति क्वेरी पुनर्प्राप्ति लागत की गणना करें. प्रबंधित वेक्टर डेटाबेस के लिए, प्रत्येक समानता खोज क्वेरी की लागत एक प्रतिशत के अंश के बराबर होती है। पाइनकोन सर्वरलेस प्रति मिलियन रीड यूनिट के लिए लगभग $8 का शुल्क लेता है, प्रत्येक क्वेरी अनुरोधित परिणामों की संख्या के आधार पर 5 से 10 रीड यूनिट की खपत करती है। स्व-होस्ट किए गए समाधानों के लिए, क्वेरी लागत निश्चित होस्टिंग व्यय से परे प्रभावी रूप से शून्य है। पुनर्प्राप्ति लागत आमतौर पर आरएजी पाइपलाइन का सबसे छोटा घटक है।
- 4प्रति प्रश्न एलएलएम अनुमान लागत की गणना करें, जो आमतौर पर प्रमुख व्यय है। प्रत्येक RAG क्वेरी उपयोगकर्ता को इनपुट टोकन के रूप में प्रश्न और पुनर्प्राप्त दस्तावेज़ खंड भेजती है, फिर आउटपुट टोकन के रूप में एक प्रतिक्रिया उत्पन्न करती है। यदि आप 400 टोकन के 5 टुकड़े प्राप्त करते हैं और साथ ही 200-टोकन सिस्टम प्रॉम्प्ट और 100-टोकन उपयोगकर्ता क्वेरी प्राप्त करते हैं, तो कुल इनपुट 2,300 टोकन है। GPT-4o पर 500-टोकन प्रतिक्रिया के साथ, प्रत्येक क्वेरी की लागत लगभग $0.011 है। 20,000 मासिक प्रश्नों पर, एलएलएम की कुल लागत $212 है।
- 5कॉर्पस अपडेट के लिए पुन: एम्बेडिंग लागत जोड़ें। यदि आपके 5 प्रतिशत दस्तावेज़ मासिक रूप से बदलते हैं, तो पुनः एम्बेडिंग लागत प्रारंभिक एम्बेडिंग लागत का 5 प्रतिशत है। 100,000-दस्तावेज़ कोष के लिए, इसमें लगभग $0.05 प्रति माह जुड़ता है, जो नगण्य है। हालाँकि, यदि आप एम्बेडिंग मॉडल (वार्षिक अनुशंसित) को अपग्रेड करते समय पूरे कॉर्पस को फिर से एम्बेड करते हैं, तो आवधिक व्यय के रूप में पूर्ण प्रारंभिक एम्बेडिंग लागत के लिए बजट बनाएं।
- 6विकास और परिचालन ओवरहेड में कारक। आरएजी पाइपलाइनों को पुनर्प्राप्ति गुणवत्ता, चंकिंग रणनीति ट्यूनिंग और कभी-कभी पुन: अनुक्रमण के लिए निगरानी की आवश्यकता होती है। उत्पादन आरएजी प्रणाली को बनाए रखने के लिए इंजीनियरिंग समय में आम तौर पर प्रति माह 5 से 10 घंटे का खर्च होता है, जो $100 से $200 प्रति घंटा होता है, जिससे श्रम लागत में $500 से $2,000 जुड़ जाता है। हालांकि यह प्रत्यक्ष बुनियादी ढांचा लागत नहीं है, इस परिचालन ओवरहेड को स्वामित्व गणना की कुल लागत में शामिल किया जाना चाहिए।
- 7प्रत्येक घटक को कुल लागत के प्रतिशत के रूप में दिखाते हुए संपूर्ण लागत विवरण की समीक्षा करें। अधिकांश आरएजी प्रणालियों के लिए, एलएलएम अनुमान 60 से 80 प्रतिशत पर हावी है, वेक्टर डेटाबेस होस्टिंग 15 से 30 प्रतिशत है, और एम्बेडिंग प्लस पुनर्प्राप्ति एक साथ 5 प्रतिशत से कम का प्रतिनिधित्व करती है। इस वितरण का मतलब है कि मॉडल चयन, शीघ्र संपीड़न, या पुनर्प्राप्त चंक गिनती को कम करने के माध्यम से एलएलएम लागत को अनुकूलित करने से कुल लागत पर सबसे अधिक प्रभाव पड़ता है।
हल किए गए उदाहरण
▾
एंबेडिंग लागत एक बार में $0.06 पर नगण्य है। इस पैमाने पर वेक्टर डीबी सर्वरलेस की लागत लगभग $10 प्रति माह है। GPT-4o-मिनी के साथ एलएलएम की लागत लगभग $32 प्रति माह है (5,000 प्रश्न x 1,400 इनपुट टोकन x $0.15/1M + 300 आउटपुट x $0.60/1M)। यह छोटे व्यवसायों के लिए एक किफायती RAG सेटअप है।
1एम वैक्टर को संभालने वाले पी2 पॉड के लिए वेक्टर डीबी की लागत $200 प्रति माह है। एलएलएम अनुमान $1,950 प्रति माह पर हावी है: $3/1M पर 3,200 इनपुट टोकन (6 खंड x 500 + ओवरहेड) के साथ 50,000 प्रश्न और $15/1M पर 600 आउटपुट टोकन। एम्बेडिंग परिशोधन लागत लगभग $25 प्रति माह जुड़ती है।
$80 प्रति माह पर स्व-होस्टेड पीजीवेक्टर प्रबंधित डेटाबेस प्रीमियम से बचता है। $0.15/$0.60 पर GPT-4o-मिनी 30,000 प्रश्नों के लिए एलएलएम की लागत $99 प्रति माह रखता है। एंबेडिंग लागत का परिशोधन प्रति माह $3 जोड़ता है। यह आर्किटेक्चर $200 प्रति माह से कम कीमत पर 90 प्रतिशत एंटरप्राइज़ RAG गुणवत्ता प्रदान करता है।
वास्तविक अनुप्रयोग
▾
ग्राहक सहायता प्लेटफ़ॉर्म ग्राहकों के प्रश्नों के त्वरित, सटीक उत्तर प्रदान करने के लिए उनके सहायता दस्तावेज़ और पिछले टिकट समाधानों पर आरएजी सिस्टम का निर्माण करते हैं। 50,000 सहायता लेखों वाली एक SaaS कंपनी GPT-4o-मिनी RAG पाइपलाइन के माध्यम से 100,000 मासिक सहायता प्रश्नों को सेवा प्रदान करती है, जो लगभग $400 प्रति माह खर्च करती है। यह 60 से 70 प्रतिशत प्रश्नों को स्वचालित रूप से संभालता है, 24/7 त्वरित प्रतिक्रिया प्रदान करते हुए मानव एजेंट लागत में $50,000 से $80,000 प्रति माह की बचत करता है।
कानूनी अनुसंधान प्लेटफ़ॉर्म लाखों अदालती राय, क़ानून और विनियमों को एम्बेड करते हैं ताकि वकीलों को प्राकृतिक भाषा प्रश्नों के माध्यम से प्रासंगिक मिसालें ढूंढने में सक्षम बनाया जा सके। विश्लेषण के लिए क्लाउड सॉनेट 4 और पुनर्प्राप्ति के लिए पाइनकोन का उपयोग करके 5 मिलियन दस्तावेज़ खंडों वाला एक कानूनी एआई स्टार्टअप 20,000 जटिल कानूनी प्रश्नों को पूरा करने के लिए प्रति माह लगभग 5,000 डॉलर खर्च करता है। प्रत्येक प्रश्न जिसमें पैरालीगल 30 से 60 मिनट लगेंगे उसका उत्तर 10 सेकंड से कम समय में दिया जाता है।
चिकित्सकों के लिए साक्ष्य-आधारित निर्णय समर्थन प्रदान करने के लिए हेल्थकेयर संगठन नैदानिक दिशानिर्देशों, दवा डेटाबेस और चिकित्सा साहित्य पर आरएजी सिस्टम का निर्माण करते हैं। 15,000 मासिक चिकित्सकों के प्रश्नों को पूरा करने वाले 2 मिलियन चिकित्सा दस्तावेजों वाली एक अस्पताल प्रणाली लगभग 1,200 डॉलर प्रति माह खर्च करती है। आरएजी प्रणाली प्रत्येक उत्तर में विशिष्ट दिशानिर्देश अनुभागों और शोध पत्रों का हवाला देती है, जो चिकित्सा सेटिंग्स में आवश्यक ट्रेसबिलिटी प्रदान करती है।
ई-कॉमर्स कंपनियां उत्पाद अनुशंसा चैटबॉट को शक्ति प्रदान करने के लिए RAG का उपयोग करती हैं जो प्रासंगिक उत्पाद विनिर्देशों, समीक्षाओं और तुलना डेटा को पुनः प्राप्त करके उत्पादों के बारे में विस्तृत प्रश्नों का उत्तर दे सकता है। GPT-4o-मिनी RAG पाइपलाइन के माध्यम से 500,000 उत्पाद पृष्ठों वाला एक खुदरा विक्रेता 200,000 मासिक खरीदारों के प्रश्नों को सेवा प्रदान करता है और प्रति माह लगभग $800 खर्च करता है। इससे ग्राहकों को सही उत्पाद तेजी से ढूंढने में मदद करके रूपांतरण दर 15 से 25 प्रतिशत तक बढ़ जाती है।
विशेष मामले
▾
आरएजी सिस्टम के लिए जिन्हें वास्तविक समय डेटा अपडेट (जैसे समाचार फ़ीड) को संभालने की आवश्यकता होती है
आरएजी सिस्टम के लिए जिन्हें वास्तविक समय डेटा अपडेट (जैसे समाचार फ़ीड, स्टॉक मूल्य, या लाइव दस्तावेज़ीकरण) को संभालने की आवश्यकता होती है, पारंपरिक बैच एम्बेडिंग और इंडेक्सिंग दृष्टिकोण अस्वीकार्य विलंबता का परिचय देता है। स्ट्रीमिंग आरएजी आर्किटेक्चर जो निर्माण के कुछ सेकंड के भीतर दस्तावेजों को एम्बेड और इंडेक्स करते हैं, उन्हें तेज लेखन प्रदर्शन के साथ हमेशा चालू एम्बेडिंग सेवाओं और वेक्टर डेटाबेस की आवश्यकता होती है। यह बैच प्रोसेसिंग की तुलना में एम्बेडिंग इंफ्रास्ट्रक्चर लागत को 5 से 10 गुना तक बढ़ा सकता है, क्योंकि आप आवधिक बैच नौकरियों के बजाय निरंतर गणना के लिए भुगतान कर रहे हैं।
मल्टी-मॉडल आरएजी सिस्टम जो छवियों, तालिकाओं आदि को पुनर्प्राप्त और तर्क करते हैं
मल्टी-मॉडल आरएजी सिस्टम जो टेक्स्ट के अलावा छवियों, तालिकाओं और आरेखों को पुनर्प्राप्त और तर्क करते हैं, उन्हें काफी अधिक लागत का सामना करना पड़ता है। दस्तावेज़ छवियों को एम्बेडिंग में परिवर्तित करने के लिए विज़न मॉडल की आवश्यकता होती है जिसकी लागत टेक्स्ट एम्बेडिंग की तुलना में प्रति टोकन 5 से 20 गुना अधिक होती है। टेक्स्ट एम्बेडिंग के साथ छवि एम्बेडिंग संग्रहीत करने से वेक्टर डेटाबेस का आकार बढ़ जाता है। और पुनर्प्राप्त छवियों को GPT-4o विज़न जैसे मल्टी-मोडल एलएलएम में पास करने पर प्रति छवि 500 से 2,000 टोकन की खपत होती है। एक मल्टी-मॉडल आरएजी पाइपलाइन की लागत केवल-टेक्स्ट समकक्ष से 3 से 5 गुना अधिक हो सकती है।
स्वास्थ्य देखभाल और वित्त जैसे उच्च विनियमित उद्योगों के लिए, आरएजी पाइपलाइनें अवश्य होनी चाहिए
स्वास्थ्य देखभाल और वित्त जैसे उच्च विनियमित उद्योगों के लिए, आरएजी पाइपलाइनों में ऑडिट लॉगिंग, एक्सेस नियंत्रण और डेटा वंशावली ट्रैकिंग शामिल होनी चाहिए जो बुनियादी ढांचे की जटिलता और लागत को जोड़ती है। अनुपालन उद्देश्यों के लिए क्वेरी लॉग, पुनर्प्राप्त दस्तावेज़ और एलएलएम प्रतिक्रियाओं को संग्रहीत करने से प्रति माह अतिरिक्त भंडारण लागत में $50 से $200 जुड़ सकते हैं। डेटा रेजिडेंसी आवश्यकताओं को पूरा करने के लिए एक निजी वीपीसी या ऑन-प्रिमाइसेस वातावरण के भीतर संपूर्ण पाइपलाइन चलाने से मानक क्लाउड तैनाती की तुलना में बुनियादी ढांचे की लागत 2 से 3 गुना बढ़ सकती है।
आरएजी पाइपलाइन घटक लागत सीमाएं (2025)
▾
| अवयव | बजट विकल्प | मध्य-श्रेणी विकल्प | उद्यम विकल्प |
|---|---|---|---|
| एम्बेडिंग (100K दस्तावेज़) | $0.06 (3-छोटा) | $0.92 (3-छोटा + ओवरलैप) | $9.20 (3-बड़ा + ओवरलैप) |
| वेक्टर डेटाबेस | $0-50/माह (पीजीवेक्टर) | $70-100/महीना (पाइनकोन एस1) | $200-500/महीना (पाइनकोन पी2) |
| प्रति प्रश्न एलएलएम | $0.001 (GPT-4o-मिनी) | $0.011 (जीपीटी-4o) | $0.025 (क्लाउड सॉनेट 4) |
| मासिक (10K प्रश्न) | $60-100 | $180-300 | $450-750 |
| मासिक (100K प्रश्न) | $150-350 | $1,200-1,800 | $2,800-4,500 |
अक्सर पूछे जाने वाले प्रश्न
▾
RAG पाइपलाइन में सबसे बड़ा लागत चालक क्या है?
एलएलएम अनुमान प्रमुख लागत है, जो आमतौर पर कुल मासिक खर्च का 60 से 80 प्रतिशत होता है। ऐसा इसलिए है क्योंकि प्रत्येक क्वेरी हजारों पुनर्प्राप्त संदर्भ टोकन और उपयोगकर्ता क्वेरी को एलएलएम को भेजती है। सबसे प्रभावी लागत अनुकूलन रणनीतियाँ इस घटक को लक्षित करती हैं: GPT-4o-मिनी जैसे सस्ते मॉडल का उपयोग करना, पुनर्प्राप्त किए गए टुकड़ों की संख्या को कम करना, एलएलएम को भेजने से पहले संदर्भ को संपीड़ित करना और लगातार क्वेरी परिणामों को कैश करना।
मैं पाइनकोन, वीविएट और पीजीवेक्टर के बीच कैसे चयन करूं?
पाइनकोन को स्थापित करना और स्केल करना सबसे आसान है लेकिन बड़ी तैनाती के लिए यह सबसे महंगा है। Weaviate एक उदार निःशुल्क स्तर के साथ सुविधाओं और लागत का एक अच्छा संतुलन प्रदान करता है। किसी भी मानक डेटाबेस सर्वर पर चलने वाले PostgreSQL विशेषज्ञता वाली टीमों के लिए pgvector सबसे सस्ता विकल्प है। 100,000 वैक्टर से कम के कॉर्पोरा के लिए, $50 वीएम पर पीजीवेक्टर आमतौर पर पर्याप्त होता है। 100,000 से 10 मिलियन वैक्टर के लिए, पाइनकोन सर्वर रहित या वीविएट क्लाउड बेहतर प्रदर्शन-से-लागत अनुपात प्रदान करते हैं।
मुझे प्रति क्वेरी कितने भाग प्राप्त करने चाहिए?
3 से 5 खंडों से प्रारंभ करें और उत्तर की गुणवत्ता मापें। अधिक खंड पुनर्प्राप्त करने से अधिक संदर्भ मिलता है लेकिन एलएलएम इनपुट टोकन और लागत बढ़ जाती है। 5 से 7 खंडों के अलावा, अतिरिक्त संदर्भ में अक्सर अनावश्यक या अप्रासंगिक जानकारी होती है जो मॉडल को भ्रमित कर सकती है और उत्तर की गुणवत्ता को ख़राब कर सकती है। 10 से 20 उम्मीदवारों की प्रारंभिक पुनर्प्राप्ति से सबसे अधिक प्रासंगिक 3 से 5 खंडों का चयन करने के लिए पुन: रैंकिंग चरण (जैसे कि कोहेयर रीरैंक या क्रॉस-एनकोडर मॉडल) का उपयोग करें।
क्या मैं RAG उत्पादन के लिए निःशुल्क वेक्टर डेटाबेस का उपयोग कर सकता हूँ?
हाँ, छोटे से मध्यम तैनाती के लिए। मौजूदा PostgreSQL सर्वर पर चलने वाला pgvector शून्य अतिरिक्त लागत जोड़ता है। क्रोमा और FAISS 1 मिलियन वैक्टर के तहत कॉर्पोरा के लिए इन-मेमोरी चला सकते हैं। वीविएट क्लाउड विकास और छोटे उत्पादन कार्यभार के लिए उपयुक्त एक निःशुल्क सैंडबॉक्स टियर प्रदान करता है। ये विकल्प मध्यम क्वेरी वॉल्यूम के साथ 100,000 से 500,000 वैक्टर तक व्यवहार्य हैं, हालांकि उनमें भुगतान प्रबंधित सेवाओं की विश्वसनीयता की गारंटी की कमी हो सकती है।
चंकिंग रणनीति आरएजी लागतों को कैसे प्रभावित करती है?
छोटे टुकड़े (128 से 256 टोकन) संग्रहीत और पुनर्प्राप्त किए गए वैक्टर की संख्या बढ़ाते हैं लेकिन अधिक सटीक संदर्भ प्रदान करते हैं। बड़े हिस्से (512 से 1024 टोकन) वेक्टर गिनती को कम करते हैं लेकिन प्रत्येक पुनर्प्राप्ति में अप्रासंगिक सामग्री शामिल कर सकते हैं। इष्टतम खंड आकार आपके दस्तावेज़ प्रकार और क्वेरी पैटर्न पर निर्भर करता है। अधिकांश उपयोग के मामलों के लिए, 50 से 100 टोकन ओवरलैप के साथ 256 से 512 टोकन पुनर्प्राप्ति परिशुद्धता और लागत दक्षता का सर्वोत्तम संतुलन प्रदान करते हैं।
आरएजी सिस्टम को शुरू से बनाने की कुल लागत क्या है?
उत्पादन आरएजी प्रणाली के लिए विकास लागत आम तौर पर 80 से 200 इंजीनियरिंग घंटे (श्रम में 8,000 डॉलर से 30,000 डॉलर) है। इसमें दस्तावेज़ प्रसंस्करण पाइपलाइन, चंकिंग और एम्बेडिंग, वेक्टर डेटाबेस सेटअप, पुनर्प्राप्ति तर्क, एलएलएम एकीकरण, मूल्यांकन ढांचा और निगरानी शामिल है। चल रही बुनियादी ढांचे की लागत छोटी तैनाती के लिए $50 प्रति माह से लेकर उद्यम पैमाने के लिए $5,000 या अधिक प्रति माह तक होती है। अधिकांश टीमें 4 से 8 सप्ताह के भीतर उत्पादन-तैयार गुणवत्ता तक पहुंच जाती हैं।
सामान्य गलतियां जिनसे बचना है
▾
- !एलएलएम के लिए बहुत अधिक पुनर्प्राप्त खंड पास करना:
- !बजट मॉडल पर्याप्त होने पर सबसे महंगे एलएलएम का उपयोग करना:
- !छोटे कॉर्पोरा के लिए वेक्टर डेटाबेस का अति-प्रावधान:
विशेष टिप
एक सिमेंटिक कैश लागू करें जो पिछले प्रश्नों के एम्बेडिंग और उनके उत्पन्न उत्तरों को संग्रहीत करता है। जब कोई नई क्वेरी शब्दार्थ रूप से कैश्ड क्वेरी के समान होती है (0.95 से ऊपर कोसाइन समानता), तो पूर्ण RAG पाइपलाइन चलाने के बजाय कैश्ड उत्तर लौटाएँ। यह दोहराए जाने वाले क्वेरी पैटर्न वाले अनुप्रयोगों के लिए एलएलएम अनुमान लागत को 30 से 50 प्रतिशत तक कम कर सकता है, जैसे ग्राहक सहायता जहां समान प्रश्न अक्सर पूछे जाते हैं।
क्या आप जानते हैं?
रिट्रीवल-ऑगमेंटेड जेनरेशन की अवधारणा फेसबुक एआई रिसर्च (अब मेटा एआई) द्वारा 2020 के पेपर में पेश की गई थी। तब से, आरएजी उत्पादन एलएलएम अनुप्रयोगों के निर्माण के लिए सबसे व्यापक रूप से अपनाया जाने वाला पैटर्न बन गया है, जिसका उपयोग अनुमानित 80 प्रतिशत एंटरप्राइज़ एआई तैनाती द्वारा किया जाता है। पुनर्प्राप्ति और पीढ़ी का संयोजन कच्चे एलएलएम के साथ दो सबसे बड़ी समस्याओं को हल करता है: मतिभ्रम और मालिकाना या वर्तमान डेटा तक पहुंच की कमी।
Regional Guides
▾
North America▾
Europe▾
Asia-Pacific▾
संदर्भ
साप्ताहिक गणित युक्तियाँ प्राप्त करें
12,000+ सब्सक्राइबर्स से जुड़ें जिन्हें हर हफ्ते कैलकुलेटर टिप्स मिलते हैं।