एक ही पाठ के लिए मुफ़्त ऑनलाइन उपकरण अलग-अलग शब्द संख्या क्यों देते हैं
हर लेखक के पास उस चालान की कहानी है जो कम पड़ गया। आप तैयार लेख ग्राहक के मुफ़्त ऑनलाइन उपकरण में चिपकाते हैं और कुल आपके अपने आँकड़े से तीन प्रतिशत कम निकलता है। 1,200 शब्दों का लेख 1,164 शब्द बन जाता है, और वेब लेखन की सामान्य दरों €0.08 से €0.40 प्रति शब्द पर वह अंतर असली पैसा है। उल्टी दिशा में भी यही होता है, जब कोई फ़ॉर्म आपका परिचय इसलिए अस्वीकार कर देता है कि गिनने वाले को पाँच ऐसे वर्ण दिखते हैं जो आपको मिलते ही नहीं।
यह न कोई ख़राबी है और न ही अक्सर बेईमानी। शब्द और वर्ण गिनना मनमानी परंपराओं का समुच्चय है, और हर एप्लिकेशन — वर्ड, गूगल डॉक्स, ब्राउज़र का गिनने वाला, किसी सीएमएस का फ़ील्ड — थोड़ा अलग नियमपुस्तक लागू करता है। यह मार्गदर्शिका बताती है कि आँकड़े क्यों अलग होते हैं, वे सीमाएँ कहाँ हैं जो सचमुच मायने रखती हैं, और आप वह गिनती कैसे चुनें जिसका आप भुगतान चाहते हैं, या जो आपकी पोस्ट को पास होने देगी।
एक ही अनुच्छेद, तीन अलग आँकड़े#
समस्या को छोटे पैमाने पर देखने के लिए वही छोटा अनुच्छेद तीन मुफ़्त ऑनलाइन उपकरणों या वर्ड प्रोसेसरों में चिपकाइए। नीचे का पाठ केवल एक वाक्य है, फिर भी शब्द संख्या इस पर बदल जाती है कि हाइफ़न, संक्षिप्त रूप और विराम चिह्न शब्द-सीमा माने गए या नहीं। माइक्रोसॉफ़्ट वर्ड और अधिकांश वर्ड प्रोसेसर हाइफ़न वाले समास और संक्षिप्त रूप जोड़े रखते हैं; नियमित अभिव्यक्ति पर आधारित ब्राउज़र का गिनने वाला उन्हें तोड़ सकता है। वर्ण संख्या अधिक स्थिर है, पर वह भी बदलती है यदि अंत के रिक्त स्थान या पंक्ति-विराम गिने जाएँ।
| उपकरण | शब्द संख्या | रिक्त स्थान सहित वर्ण |
|---|---|---|
| माइक्रोसॉफ़्ट वर्ड | 14 | 100 |
| ब्राउज़र गिनने वाला A (हाइफ़न पर तोड़ता है) | 19 | 100 |
| ब्राउज़र गिनने वाला B (हाइफ़न और अपॉस्ट्रॉफ़ी पर तोड़ता है) | 20 | 100 |
सटीक आँकड़े उपकरण के संस्करण और सेटिंग पर निर्भर करते हैं; इन्हें उदाहरण मानिए, विनिर्देश नहीं।
आँकड़े अलग क्यों होते हैं#
इस बारे में कोई आईएसओ मानक नहीं है कि शब्द किसे गिना जाए। वर्ड प्रोसेसर आमतौर पर शब्द को अक्षरों, अंकों या जोड़ने वाले चिह्नों — जैसे अपॉस्ट्रॉफ़ी और हाइफ़न — की ऐसी शृंखला मानता है जो रिक्त स्थान या विराम चिह्न से घिरी हो। कोई वेब फ़ॉर्म केवल रिक्त स्थान पर तोड़ सकता है। कोई प्रोग्रामिंग स्क्रिप्ट ऐसी नियमित अभिव्यक्ति उपयोग कर सकती है जो अक्षर या अंक न होने वाली हर चीज़ पर तोड़ दे। चूँकि स्रोत पाठ एक ही है, अंतर ग़लती जैसा लगता है; असल में हर उपकरण अलग प्रश्न का उत्तर दे रहा है।
- हाइफ़न: कुछ उपकरण ”सास-बहू” को एक शब्द मानते हैं; दूसरे दोनों हिस्से अलग गिनते हैं।
- संक्षिप्त रूप और अपॉस्ट्रॉफ़ी: ”it's” एक शब्द भी गिना जा सकता है और दो भी।
- अंक और मुद्रा: ”€50” एक इकाई गिना जा सकता है या ”50” और ”€” में बँट सकता है।
- शब्दों से चिपके विराम चिह्न: अल्पविराम, पूर्ण विराम और बंद करने वाले उद्धरण हटाए भी जा सकते हैं और विभाजक भी गिने जा सकते हैं।
- पंक्ति-विराम और दोहरे रिक्त स्थान: कुछ गिनने वालों में दोहरा रिक्त स्थान एक ख़ाली शब्द बना सकता है।
- ग़ैर-लातीनी लिपियाँ: चीनी, जापानी और कोरियाई रिक्त स्थान उपयोग नहीं करतीं, इसलिए रिक्त स्थान पर आधारित गिनती पूरी तरह विफल हो जाती है।
वे वर्ण सीमाएँ जिनसे लोग सचमुच टकराते हैं#
वर्ण सीमाएँ आमतौर पर कठोर दीवारें होती हैं: कोई फ़ॉर्म अतिरिक्त वर्ण सीधे अस्वीकार कर देता है, या कोई खोज इंजन आपका अंश काट देता है। जो सीमा मायने रखती है वह उस प्रणाली की है जो पाठ प्रकाशित करेगी, उस उपकरण की नहीं जिसमें आपने लिखा। यदि आप किसी सीएमएस के लिए लिख रहे हैं तो उसी में परखिए; यदि मेटा विवरण लिख रहे हैं तो वर्ण संख्या के साथ पिक्सेल चौड़ाई भी जाँचिए, क्योंकि गूगल पिक्सेल के हिसाब से काटता है, वर्णों के नहीं।
| फ़ील्ड | सामान्य सीमा | क्या गिना जाता है |
|---|---|---|
| गूगल का title टैग | ~60 वर्ण | वर्ण और रिक्त स्थान; असली सीमा पिक्सेल चौड़ाई है |
| गूगल का मेटा विवरण | ~155–160 वर्ण | वर्ण और रिक्त स्थान; मोबाइल पर प्रायः पहले ही कट जाता है |
| X पर पोस्ट | 280 वर्ण | रिक्त स्थान, विराम चिह्न और URL छोटे किए गए t.co लिंक के रूप में गिने जाते हैं |
| Bluesky पर पोस्ट | 300 वर्ण | रिक्त स्थान सहित सभी वर्ण |
| एसएमएस (GSM-7 वर्णमाला) | प्रति संदेश 160 वर्ण | अक्षर, अंक और कुछ चिह्न; लंबा पाठ बँट जाता है |
| एसएमएस (UCS-2 एन्कोडिंग) | प्रति संदेश 70 वर्ण | ग़ैर-लातीनी लिपियाँ और कुछ इमोजी; लंबा पाठ बँट जाता है |
| डेटाबेस VARCHAR(255) | 255 वर्ण | घोषित एन्कोडिंग में वर्ण; इमोजी कई बाइट ले सकते हैं |
सीमा एक अनुबंध है; लिखिए जिस भी उपकरण में चाहें, पर अंतिम प्रणाली में जाँच अवश्य कीजिए।
चीनी, जापानी, कोरियाई और इमोजी सरल गिनती कैसे तोड़ देते हैं#
साधारण गिनने वाले आमतौर पर स्ट्रिंग की लंबाई बाइट, यूनिकोड कोड बिंदु या ग्राफ़ीम समूहों में लौटाते हैं। ये तीनों आँकड़े बहुत भिन्न हो सकते हैं। एक चीनी वर्ण उपयोगकर्ता को दिखने वाला एक वर्ण और एक कोड बिंदु है, पर UTF-8 में वह तीन बाइट ले सकता है। त्वचा-रंग संशोधक वाला इमोजी एक दिखने वाला ग्लिफ़, दो कोड बिंदु और चार बाइट होता है। परिवार वाले इमोजी में सात कोड बिंदु और केवल एक ग्लिफ़ हो सकता है। यदि आपका गिनने वाला बाइट गिनता है, तो आपका चीनी उपन्यास विशाल दिखेगा।
| उदाहरण | दिखने वाले वर्ण | कोड बिंदु | UTF-8 बाइट |
|---|---|---|---|
| लातीनी ”A” | 1 | 1 | 1 |
| चीनी ”中” | 1 | 1 | 3 |
| अंगूठा दिखाने वाला इमोजी | 1 | 1 | 4 |
| त्वचा-रंग वाला अंगूठा इमोजी | 1 | 2 | 8 |
| झंडे का इमोजी | 1 | 2 | 8 |
| परिवार का इमोजी | 1 | 7 | 25 |
उपयोगकर्ता को दिखने वाली सीमाओं के लिए ग्राफ़ीम समूह गिनिए; भंडारण के लिए बाइट गिनिए।
आपको कौन-सा आँकड़ा लेना चाहिए?#
यदि आप प्रति शब्द चालान बनाते हैं तो केवल वही आँकड़ा मायने रखता है जो आपके अनुबंध या ग्राहक के संक्षेप में लिखा है। यदि उसमें ”माइक्रोसॉफ़्ट वर्ड की गिनती” लिखा हो तो वर्ड उपयोग कीजिए। यदि ”प्रति स्रोत शब्द” लिखा हो तो सहमत उपकरण में मूल पाठ गिनिए। इक्के-दुक्के काम में शुरू करने से पहले एक नमूने पर सहमति बना लीजिए। स्वतंत्र वेब लेखन की दरें आमतौर पर €0.08 से €0.40 प्रति शब्द रहती हैं, निचला सिरा थोक ब्लॉग लेखों के लिए और ऊपरी तकनीकी या तात्कालिक पाठ के लिए; गिनने की विधि दर के साथ ही लिखी जानी चाहिए, क्योंकि इन क़ीमतों पर 5 प्रतिशत का अंतर मामूली नहीं है।
- वेब पर त्वरित जाँच: ब्राउज़र का गिनने वाला पर्याप्त है।
- थोक चालान या ग्राहक रिपोर्ट: एक सुसंगत सूत्र वाली स्प्रेडशीट बेहतर है, या वर्ड के अंतर्निहित गिनने वाले जैसा स्थानीय एप्लिकेशन।
- कानूनी, चिकित्सा या वित्तीय दस्तावेज़: किसी पेशेवर की मदद लीजिए या नियामक द्वारा अनिवार्य उपकरण उपयोग कीजिए; अनुपालन के लिए कभी किसी मुफ़्त ऑनलाइन उपकरण पर भरोसा मत कीजिए।
- प्रोग्रामिंग और डेटाबेस की सीमाएँ: लक्ष्य एन्कोडिंग में भाषा का स्ट्रिंग-लंबाई फ़ंक्शन उपयोग कीजिए।
- सोशल मीडिया पोस्ट: लिखिए कहीं भी, पर अंतिम गिनती के लिए प्लेटफ़ॉर्म में चिपकाइए।
यह मार्गदर्शन है, कानूनी या वित्तीय सलाह नहीं; गिनने की विधि अपने अनुबंध में लिख लीजिए।
निजता: वे उपकरण जो बिना बताए आपका पाठ भेज देते हैं#
कई मुफ़्त ऑनलाइन उपकरण आपके उपकरण पर चलने वाले कैलकुलेटर नहीं हैं; वे किसी क्लाउड सेवा का मुखौटा हैं। आप पाठ चिपकाते हैं और वह विश्लेषण, भंडारण या मॉडल प्रशिक्षण के लिए किसी सर्वर तक चला जाता है। सार्वजनिक ब्लॉग लेख के लिए यह ठीक है, पर किसी अप्रकाशित पांडुलिपि, गोपनीयता समझौते के अंतर्गत आए संक्षेप, या व्यक्तिगत डेटा वाले मसौदे के लिए यह बुरा चुनाव है। जो उपकरण ब्राउज़र में ही रहते हैं — जैसे siteb.biz द्वारा प्रकाशित पाँच गिनने वाले — पूरी तरह आपके साथ काम करते हैं और पाठ कभी नहीं भेजते, फिर भी नेटवर्क टैब जाँच लेना समझदारी है।
- साइट शब्द गिनने के लिए भी लॉगिन माँगती है।
- गिनने वाला व्याकरण सुधार, सारांश या अनुवाद भी देता है — ऐसे काम जिनके लिए पाठ समझना ज़रूरी है।
- चिपकाते ही विश्लेषण या कृत्रिम बुद्धिमत्ता सेवाओं को नेटवर्क अनुरोध जाते हैं।
- निजता नीति कहती है कि सामग्री सेवाओं को बेहतर बनाने में उपयोग की जा सकती है।
- कोई निजता नीति ही नहीं है।
संदेह हो तो कोई स्थानीय एप्लिकेशन या स्प्रेडशीट उपयोग कीजिए।
भरोसेमंद गिनने वाला कैसे चुनें#
अच्छा गिनने वाला बताता है कि वह क्या गिन रहा है। स्पष्ट कथन खोजिए: ”रिक्त स्थान से अलग किए गए शब्द”, ”यूनिकोड कोड बिंदु” या ”ग्राफ़ीम समूह”। उसे किसी ज्ञात स्ट्रिंग से परखिए जिसमें हाइफ़न, संक्षिप्त रूप, इमोजी और एक चीनी वर्ण हो। यदि परिणाम अपेक्षा से मेल खाए तो उपकरण शायद उस काम के लिए उपयुक्त है। याद रखिए कि कोई उपकरण हर काम के लिए ठीक नहीं होता; सही वही है जो उस सीमा से मेल खाए जिसे आप निभाना चाहते हैं।
- सीमा पहचानिए: चालान के लिए शब्द संख्या, फ़ॉर्म के लिए वर्ण, डेटाबेस के लिए बाइट।
- वह प्रणाली खोजिए जो सीमा लगाती है और उसी की गिनती को मानक मानिए।
- ऐसा उपकरण चुनिए जो अपनी गिनने की नियम-पद्धति समझाए, या किसी परीक्षण स्ट्रिंग से उसकी पुष्टि कीजिए।
- संवेदनशील पाठ के लिए ब्राउज़र में ही रहने वाले गिनने वाले या स्थानीय एप्लिकेशन को प्राथमिकता दीजिए।
- यदि पैसा या अनुपालन दाँव पर हो तो गिनती की स्क्रीनशॉट या प्रति सुरक्षित रखिए।
अक्सर पूछे जाने वाले प्रश्न
माइक्रोसॉफ़्ट वर्ड किसी मुफ़्त ऑनलाइन उपकरण से अलग शब्द संख्या क्यों देता है?
माइक्रोसॉफ़्ट वर्ड एक आंतरिक शब्द-विभाजन एल्गोरिथ्म उपयोग करता है जो हाइफ़न वाले समास, संक्षिप्त रूप और अंक तब तक जोड़े रखता है जब तक उनके बीच रिक्त स्थान न हो। ब्राउज़र का गिनने वाला प्रायः एक सरल नियमित अभिव्यक्ति उपयोग करता है जो हाइफ़न और अपॉस्ट्रॉफ़ी को सीमा मानती है, इसलिए एक समास दो शब्द बन जाता है। कुछ उपकरण विराम चिह्न भी अलग ढंग से अलग करते हैं। कोई भी परिणाम ग़लत नहीं है; वे बस शब्द की अलग परिभाषाओं का पालन कर रहे हैं। व्यावहारिक समाधान यह है कि कोई भुगतान होने से पहले उपकरण और गिनने का नियम तय कर लिया जाए, और उस सहमति को अनुबंध या संक्षेप में दर्ज कर लिया जाए।
क्या ब्राउज़र के शब्द गिनने वाले गोपनीय दस्तावेज़ों के लिए सुरक्षित हैं?
यह इस पर निर्भर है कि उपकरण पूरी तरह आपके ब्राउज़र में चलता है या पाठ किसी सर्वर पर भेजता है। ब्राउज़र में ही रहने वाले गिनने वाले पाठ स्थानीय रूप से संसाधित करते हैं और उसे कभी भेजते नहीं, जिससे वे उन मसौदों के लिए उचित विकल्प बन जाते हैं जिन्हें आप सार्वजनिक नहीं करना चाहेंगे। पर कई मुफ़्त ऑनलाइन उपकरण जो व्याकरण सुधार, सारांश या कृत्रिम बुद्धिमत्ता सुविधाएँ भी देते हैं, आपका पाठ क्लाउड में भेज देते हैं। गोपनीयता समझौतों, चिकित्सा अभिलेखों, वित्तीय मसौदों या डेटा-सुरक्षा नियमों के अधीन सामग्री के लिए किसी अनजान साइट के बजाय स्थानीय एप्लिकेशन, ऑफ़लाइन स्प्रेडशीट या अपने संगठन द्वारा अनिवार्य उपकरण उपयोग कीजिए।
चीनी, जापानी, कोरियाई या इमोजी वाले पाठ को कैसे गिनूँ?
ऐसा गिनने वाला उपयोग कीजिए जो ग्राफ़ीम समूह लौटाए, कच्चे बाइट या कोड बिंदु नहीं। एक चीनी वर्ण एक ग्राफ़ीम है, पर UTF-8 में तीन बाइट। त्वचा-रंग संशोधक वाला इमोजी एक दिखने वाला वर्ण है, पर दो कोड बिंदु। झंडे या परिवार वाला इमोजी शून्य-चौड़ाई जोड़कों से जुड़े कई कोड बिंदुओं से बना एक ही दिखने वाला ग्लिफ़ हो सकता है। उपयोगकर्ता को दिखने वाली सीमाओं के लिए ग्राफ़ीम समूह ही न्यायसंगत माप हैं, क्योंकि वे वही दर्शाते हैं जो पाठक देखता है। डेटाबेस भंडारण और प्रोग्रामिंग के लिए बाइट या कोड बिंदु की लंबाई मायने रखती है, क्योंकि प्रणाली को उतनी ही जगह रखनी पड़ती है।
मुफ़्त ऑनलाइन उपकरणशब्द गिनने का उपकरणऑनलाइन वर्ण गिनने वालाएसईओ शीर्षक की वर्ण सीमाचीनी जापानी कोरियाई वर्ण गिनतीब्राउज़र में पाठ गिनने वाला