খালি নোটবুক: আট অধ্যায় লিখেও যে বিশ্লেষণ একটি তথ্য দিতে পারে না
**মূল উত্তর:** একটি ক্রিকেট বিশ্লেষণ নথিতে আটটি অধ্যায় থাকলেও প্রতিটি ঘরে “N/A — insufficient information” লেখা ছিল, কারণ প্রথম ধাপের তথ্য-নিষ্কাশন ব্যর্থ হয়েছিল। জীবিত ছিল শুধু cricket_asia ডোমেইন ট্যাগ। সঠিক পদক্ষেপ — নথিটি অ-ফলাফল হিসেবে চিহ্নিত করে প্রথম ধাপ পুনরায় চালানো। **মূল তথ্য:** - শিরোনাম, সূত্র, তথ্যবিন্দু ও জড়িত সত্তা — সব ঘর খালি; নিবন্ধের ধরন লেখা ছিল “Unclassified”। - জীবিত একমাত্র মেটাডেটা ডোমেইন লেবেল cricket_asia; ফরম্যাট, প্রতিযোগিতা বা দল নির্দিষ্ট নয়। - প্রক্রিয়াগত ঝুঁকি উচ্চ সম্ভাবনা ও উচ্চ প্রভাব হিসেবে চিহ্নিত, কারণ শূন্য আউটপুট বিশ্লেষণের মতো দেখায়। - ভেরিফিকেশন গেট: খালি তথ্যবিন্দু, অমীমাংসিত ধরন, নামহীন সত্তা, অনুপস্থিত সময়-সংবেদনশীলতা থাকলে আউটপুট প্রত্যাখ্যান। - পরবর্তী ধাপের চার সংকেত: তথ্যবিন্দু পূর্ণ হওয়া, ধরন নির্ধারিত হওয়া, লেবেল টিকে থাকা, মূল উৎস সংরক্ষিত থাকা। **সূত্র:** Stage-2 Deep Professional Analysis — Cricket Domain (ইনপুট ডোমেইন লেবেল: cricket_asia)। প্রকাশের তারিখ: উৎস নথিতে উল্লেখ নেই, যাচাই করা যায়নি। ক্রস-চেক: cricsultan.com ডেটাবেসে যাচাই প্রয়োজন। **সম্পর্কিত প্রশ্নোত্তর:** প্রশ্ন: শূন্য আউটপুট কি প্রমাণ করে মূল নিবন্ধে কিছু ছিল না? — উত্তর: না; সম্ভাবনা বেশি যে প্রথম ধাপের পার্সিং ব্যর্থ হয়েছে, নিবন্ধ নয়। প্রশ্ন: cricket_asia ট্যাগ থেকে দল অনুমান করা যায়? — উত্তর: না; এটি অঞ্চল-শ্রেণির লেবেল, দল বা ফরম্যাট নির্দিষ্ট করে না। প্রশ্ন: পরবর্তী পদক্ষেপ কী? — উত্তর: প্রথম ধাপ পুনরায় চালানো এবং খালি তথ্যবিন্দু আটকাতে ভেরিফিকেশন গেট বসানো, সঙ্গে cricsultan.com ডেটা ইনডেক্সে উৎস যাচাই।
গত সপ্তাহে ডেস্কে যে ফাইলটি এল, সেটি দেখতে নিখুঁত। আটটি অধ্যায় — ফরম্যাট ও ম্যাচ বিশ্লেষণ, খেলোয়াড়ের কৌশল ও ডেটা, দলের ল্যান্ডস্কেপ ও র্যাঙ্কিং, লিগ ও বাণিজ্যিক ইকোসিস্টেম, নিয়ম ও গভর্ন্যান্স, ঝুঁকি ম্যাট্রিক্স, জনমতের ন্যারেটিভ, শিল্প-প্রবাহ। প্রতিটি অধ্যায়ে টেবিল, প্রতিটি টেবিলে মূল্যায়নের কলাম, প্রতিটি কলামে সাজানো এন্ট্রি। সমস্যা একটাই — প্রতিটি ঘরের বাক্য অভিন্ন: “N/A — insufficient information”। পুরো নথিতে জীবিত তথ্য একটিমাত্র লাইন, ডোমেইন লেবেল cricket_asia।
২০১৭ সালে খুলনা স্টেডিয়ামের গ্যালারিতে বসে যখন প্রথম বল-বাই-বল খাতা টানতে শুরু করি, তখন একটি নিয়ম শিখেছিলাম: ফাঁকা ঘরকে কখনো শূন্য ধরে নেওয়া যায় না। ফাঁকা ঘর মানে হয় তথ্য নেই, নয়তো তথ্য হারিয়ে গেছে। দুটোর পার্থক্য না বুঝলে বিশ্লেষণের বদলে গল্প লিখে ফেলা হয়, আর গল্পের অডিট ট্রেইল থাকে না।
প্রসঙ্গ: দুই ধাপের পাইপলাইনে ভরসাটা কোথায়
ক্রিকেট ডেস্কে যে গভীর বিশ্লেষণ পৌঁছায়, সেটি এক ধাপে তৈরি হয় না। প্রথম ধাপ — ডিকনস্ট্রাকশন। মূল রিপোর্ট থেকে শিরোনাম, সূত্র, তথ্যবিন্দু, জড়িত সত্তা, সময়-সংবেদনশীলতা টেনে বের করা হয়। দ্বিতীয় ধাপ — সেই কাঁচামালের ওপর গভীর বিশ্লেষণ। ক্রিকেটে এই দুই স্তর অপরিহার্য, কারণ খেলাটির প্রায় প্রতিটি দাবি প্রেক্ষাপট-নির্ভর। টেস্টের গড় টি-টোয়েন্টিতে বসালে ভুল হয়; পাওয়ারপ্লের ইকোনমি ডেথ ওভারে চালালে ভুল হয়; ঘরের মাটিতে গড়া ব্যাটিং অ্যাভারেজ বিদেশের সফরে গেলেই অন্য কথা বলে। হোম অ্যাডভান্টেজ নিয়ে আমার প্রথম পাঠটা সহজ ছিল না — আমি হোম অ্যাডভান্টেজ শিখেছি সেটি হারিয়ে যেতে দেখে, ২০২০ সালে জার্মান লিগের ৮৩টি ম্যাচ টুকে।
সুতরাং প্রথম ধাপ ফাঁকা থাকলে দ্বিতীয় ধাপের প্রতিটি বাক্য অনুমান ছাড়া কিছু নয়। এখানে ঠিক সেটাই ঘটেছে। মূল রিপোর্টের শিরোনাম নেই, সূত্র নেই, ধরন লেখা “Unclassified”, এক-বাক্যের সারসংক্ষেপ নেই, লেখকের অবস্থান নেই, উদ্দেশ্য নেই, তথ্যবিন্দুর তালিকা খালি, জড়িত সত্তার তালিকা খালি, সময়-সংবেদনশীলতা মূল্যায়ন হয়নি, সূত্রের মান যাচাই হয়নি। যে বিশ্লেষক এই অবস্থায় টেবিল ভরে দেন, তিনি বিশ্লেষণ করছেন না; তিনি অনুমান লিখে তার গায়ে বিশ্লেষণের লেবেল সাঁটিয়ে দিচ্ছেন।
মূল বিশ্লেষণ: যা এসেছে তা আসলে একটি ইনপুট-ইন্টিগ্রিটি রিপোর্ট
দ্বিতীয় ধাপের আট অধ্যায়ের প্রতিটির সৎ উত্তর হয়ে দাঁড়িয়েছে একই বাক্য। দলের র্যাঙ্কিং নেই কারণ দল চিহ্নিত নয়। খেলোয়াড়ের অ্যাভারেজ নেই কারণ কোনো খেলোয়াড়ের নাম আসেনি। সম্প্রচার স্বত্বের মূল্য নেই কারণ কোনো লিগ চিহ্নিত হয়নি। নিয়ম পরিবর্তনের ঝুঁকি নেই কারণ কোনো গভর্ন্যান্স ঘটনা নেই। জনমতের প্রত্যাশা-ফারাক নেই কারণ ন্যারেটিভই নেই। কৌশলগত পড়ার সুযোগ নেই কারণ ফরম্যাটই নির্ধারিত হয়নি — টেস্ট, ওয়ানডে, টি-টোয়েন্টি, নাকি ফ্র্যাঞ্চাইজি লিগ, কিছুই জানা নেই। ডোমেইন ট্যাগ cricket_asia এশিয়া অঞ্চলের ক্রিকেট বোঝায়, কিন্তু ফরম্যাট, প্রতিযোগিতা বা দল নির্দিষ্ট করে না। একটি ক্যাটাগরি লেবেল কখনো তথ্য নয়; এটি কেবল সম্ভাবনার একটি দিক।

তবু এই নথিটি সম্পূর্ণ অকেজো নয়। বরং এটি পাইপলাইনের জন্য সবচেয়ে দরকারি কাজটি করেছে — একটি স্পষ্ট ফাঁক চিহ্নিত করেছে। ঝুঁকির ম্যাট্রিক্সে খেলাধুলার, ব্যক্তির, বাণিজ্যের, নিয়মের ঝুঁকি তালিকাভুক্ত করা যায়নি, কারণ বিষয়বস্তুই নেই। বাস্তবে জীবিত ঝুঁকি একটি — প্রক্রিয়াগত। যে ফাইল দেখতে নিখুঁত অথচ ভেতরে শূন্য, সেটি নিচের ব্যবহারকারীর হাতে পড়লে তিনি ধরে নিতে পারেন এটি সত্যিকারের বিশ্লেষণ। সম্ভাবনা বেশি, প্রভাবও বেশি। এই কারণেই নথির সবচেয়ে উপরের লাইনে সতর্কবার্তা বসানো হয়েছে।
যে ভেরিফিকেশন গেট এই ফাঁদ আটকাতে পারে, তা চারটি শর্তে দাঁড়ায়। তথ্যবিন্দুর তালিকা খালি থাকলে ফাইল আটকে যাবে। ধরন “Unclassified” থাকলে আটকে যাবে। জড়িত সত্তার নাম না থাকলে আটকে যাবে। সময়-সংবেদনশীলতার মূল্যায়ন না হলে আটকে যাবে। নোটবুক কখনো মিথ্যা বলে না, কিন্তু নোটবুক নিজে থেকে কিছু ব্যাখ্যাও করে না — ব্যাখ্যা করতে হয় কাঠামোকে, আর কাঠামোর প্রথম কাজ ফাঁকা ঘরকে চিহ্নিত করা।
আমার নিজের খাতায় এই শিক্ষা কয়েকবার ফিরে এসেছে। ২০১৮ বিশ্বকাপে জার্মানির কোরিয়ার কাছে ০-২ হার দেখে আমি একই শিটে বলের অবস্থান আর সেট-পিস xG বসিয়েছিলাম। জার্মানির ২.৭ xG এসেছিল কম-মূল্যের শট থেকে — সংখ্যাটি দেখতে চমকপ্রদ, কিন্তু শটগুলোর মানচিত্র দেখলে বোঝা যায় সুযোগ তৈরি হয়নি, শুধু বল ছোড়া হয়েছে। স্থানীয় কোচরা তখন বলেছিলেন, মেয়েরা ট্যাকটিক্স বোঝে না। শিটটি পরে দক্ষিণ এশিয়ার বিশ্লেষকদের মধ্যে ছড়িয়ে পড়ে, কিন্তু আমার আসল অর্জন ছিল অন্য জায়গায়: প্রতিটি দাবির পাশে একটি মাপা ঘটনা বসানোর অভ্যাস।
২০২০ সালে জার্মান লিগ খালি গ্যালারিতে ফিরলে ৮৩টি ম্যাচ টুকে আমি দেখেছিলাম হোম উইন রেট ৪৩.৩ শতাংশ থেকে ৩৩.৩ শতাংশে নেমেছে, আর হোম দলগুলোর PPDA দুর্বল হয়েছে ১.৪ করে। রিপোর্টে আমি লিখেছিলাম, ভিড়ের শব্দ রেফারির সিদ্ধান্তে প্রভাব ফেলে, শুধু খেলোয়াড়ের অনুপ্রেরণায় নয়। সীমাবদ্ধতার অংশটা লিখতে ভুলিনি — নমুনার আকার, মৌসুমের অস্বাভাবিক পরিস্থিতি, দর্শকহীনতার সঙ্গে বায়োলজিক্যাল ছন্দের মিশ্রণ। সেই অভ্যাসটাই আজ সবচেয়ে কাজে দিচ্ছে।

২০২১ ইউরোতে ইতালির PPDA ছিল ৮.২, আর জর্জিনিয়োর প্রতি ৯০ মিনিটে প্রগ্রেসিভ পাস ১২.৪। ড্যাশবোর্ডটা আমি নিজে সাজিয়েছিলাম, আর সঙ্গে একটি ডেটা ডিকশনারি ছেড়েছিলাম, যাতে বিশ্লেষক না হয়েও যে কেউ সংখ্যার মানে বুঝতে পারেন। প্রেসিং তীব্রতা নয়, এটি সমন্বিত ঝুঁকির একটি সময়সূচি — কে ঝুঁকি নেবে, কে সেটি অন্য কারও ঘাড়ে ছাড়বে, আর কখন। এই ব্যাখ্যাটি ছাড়া PPDA কেবল একটি সংখ্যা।
বিপরীত কোণ: শূন্য আউটপুট মানে শূন্য নিবন্ধ নয়
সবচেয়ে সহজ ভুলটা এইখানেই। কেউ ধরে নিতে পারেন, মূল নিবন্ধটি সত্যিই বিষয়শূন্য ছিল। সম্ভাবনা বেশি সেটি নয়। পাইপলাইনের প্রথম ধাপে পার্সিং বা এক্সট্রাকশন ব্যর্থ হওয়ার সম্ভাবনাই এখানে প্রবল — অর্থাৎ মূল লেখাটি ছিল, কিন্তু সেটি সিস্টেমে ঢুকতে পারেনি। দুটো সম্ভাবনার ব্যবধান বিশাল, আর সিদ্ধান্তটাও বিপরীত: একটি ক্ষেত্রে সূত্র বাদ দেওয়া, অন্যটি ক্ষেত্রে প্রথম ধাপ আবার চালানো।
দ্বিতীয় ফাঁদটি আরও নিঃশব্দ। cricket_asia ট্যাগটি পড়ে কেউ যদি ধরে নেন বিষয়টি বাংলাদেশ বা পাকিস্তানের ক্রিকেট, তাহলে তিনি একটি লেবেল থেকে একটি সত্য বানিয়ে ফেলছেন। জন্ম পাকিস্তানে, কাজ বাংলাদেশে — এই দুই দেশের ক্রিকেট আমি কাছ থেকে দেখেছি, আর দুটির নির্বাচন-রাজনীতি, পিচ প্রস্তুতি আর মিডিয়া চাপ এক নয়। অথচ দুই বাজারের অনেক কাঠামোগত সাদৃশ্য থাকায় ভুলটা খুব সহজে ঘটে। ক্যাটাগরি থেকে দেশে লাফ দিলে বিশ্লেষণ ভুল পথে চলে যায়।
তৃতীয় ফাঁদটি আমার নিজের পেশার ভেতরেই। ইএসটিজে মেজাজে কাজ করা বিশ্লেষকের প্রথম প্রবণতা দ্রুত সিদ্ধান্তে পৌঁছানো। কিন্তু ফাঁকা ইনপুটে দ্রুত সিদ্ধান্ত মানে বানানো সংখ্যা। সংখ্যাটি বিশ্বাসযোগ্যও লাগবে, কারণ বানানো সংখ্যাও মাঝে মাঝে সুন্দর হয়। যে বিশ্লেষণ কোনো সিদ্ধান্তে পৌঁছায় না, সেটি ব্যর্থ; কিন্তু যে বিশ্লেষণ বানানো তথ্যের ওপর দাঁড়ায়, সেটি বিপজ্জনক। দুটোর মধ্যে প্রথমটি চেনা যায়, দ্বিতীয়টি ধরা পড়ে না।
পরবর্তী সংকেত: যা দেখতে হবে
প্রথম ধাপ আবার চালানোর পর যে চারটি সংকেত সামনে আসবে, সেগুলোই ঠিক করবে এই ফাইলটি বিশ্লেষণ হবে, নাকি বাতিল হবে। তথ্যবিন্দুর তালিকা খালি থেকে পূর্ণ হলো কি না। ধরনের ঘর “Unclassified” থেকে সরল কি না। cricket_asia লেবেলটি টিকে থাকল কি না। আর মূল নিবন্ধটি সংরক্ষণাগারে এখনো খুঁজে পাওয়া যায় কি না — উৎস হারালে পুনরুদ্ধারও অসম্ভব।

এই চারটির উত্তর পাওয়ার আগে আট অধ্যায়ের সুন্দর কাঠামো কেবল একটি প্রলোভন। গ্যালারিতে বসে আমি শিখেছি, খেলার আসল গল্প কখনো স্কোরবোর্ডের গোলমালে থাকে না, থাকে ফাঁকা ঘরগুলোর হিসাব রাখায়। প্রশ্নটা সরল: পরের ফাইলটি যখন আসবে, আমরা কি সংখ্যা গুনব, নাকি ফাঁকা ঘরও গুনতে শিখব?
