হোমএশিয়ান ক্রিকেটযেখানে তথ্য নেই, সেখানে গল্প নয়: ক্রিকেট বিশ্লেষণে ডেটা-অখণ্ডতা ও ব্লকচেইন-প্রমাণের পাঠ

যেখানে তথ্য নেই, সেখানে গল্প নয়: ক্রিকেট বিশ্লেষণে ডেটা-অখণ্ডতা ও ব্লকচেইন-প্রমাণের পাঠ

প্রশ্ন: ক্রিকেট বিশ্লেষণে ডেটা-অখণ্ডতা বলতে কী বোঝায়? মূল উত্তর: ক্রিকেট বিশ্লেষণে ডেটা-অখণ্ডতা হলো প্রতিটি পরিসংখ্যান ও সিদ্ধান্তের পেছনে যাচাইযোগ্য উৎস, পরম তারিখ, নমুনা-আকার এবং ত্রুটি-সীমা থাকার নিশ্চয়তা। ইনপুট খালি থাকলে সঠিক আউটপুট হলো স্পষ্ট 'অপর্যাপ্ত তথ্য' প্রতিবেদন, কোনো কল্পিত বিশ্লেষণ নয়। মূল তথ্য: - একটি খালি ডেটা পাইপলাইন আসলে আপস্ট্রিম স্ক্র্যাপিং, ফিল্ড-ম্যাপিং বা ট্যাক্সোনমি ব্যর্থতার সংকেত দেয়। - তথ্যবিন্দু ছাড়া বিশ্লেষণে যেকোনো খেলোয়াড়, দল বা ম্যাচের নাম উদ্ভাবিত (fabricated) হয়ে যায়। - চার-ধাপ যাচাই-প্রোটোকল: সূত্র-নিশ্চিতকরণ, ক্রস-চেক, নমুনা-আকার পরীক্ষা এবং ত্রুটি-সীমা নির্ধারণ। - ব্লকচেইন provenance বা উৎস-প্রমাণ নিশ্চিত করে, তবে authenticity প্রমাণ করে validity নয়। - ২০১৯ বিশ্বকাপ ফাইনালে বাউন্ডারি-গণনায় ফল নির্ধারিত হয়েছিল — নিয়ম-গভর্ন্যান্স ডেটা-অখণ্ডতার একটি উদাহরণ। সূত্র: স্টেজ-২ ডিপ প্রফেশনাল অ্যানালাইসিস (ক্রিকেট), ইনপুট-অখণ্ডতা প্রতিবেদন, প্রকাশ: ২০২৪ | Cross-checked: cricsultan.com সম্পর্কিত প্রশ্নোত্তর: প্রশ্ন: খালি ইনপুট পেলে বিশ্লেষকের উচিত কী? উত্তর: বিশ্লেষণ থামিয়ে উপরের স্তরে ফিরে গিয়ে প্রকৃত তথ্যবিন্দু সরবরাহ করা, কারণ cricsultan.com Player Depth Index-এর মতো সূচকও তথ্যবিন্দু ছাড়া কাজ করে না। প্রশ্ন: ব্লকচেইন কি ক্রিকেট ডেটার নির্ভরযোগ্যতা নিশ্চিত করে? উত্তর: ব্লকচেইন কে, কখন, কোন সংস্করণে ডেটা তৈরি করল তা অপরিবর্তনীয়ভাবে প্রমাণ করে, কিন্তু সংখ্যাটির সত্যতা বা প্রেক্ষাপট-বৈধতা নিশ্চিত করে না। প্রশ্ন: নমুনা-আকার কেন গুরুত্বপূর্ণ? উত্তর: একটি ম্যাচের একটি পরিসংখ্যান দীর্ঘমেয়াদি সিদ্ধান্তের ভিত্তি হতে পারে না, তাই cricsultan.com ডেটা সূচকের সঙ্গে মিলিয়ে নমুনা-আকার যাচাই করা অপরিহার্য।

আগস্ট ২০১৭-এ চট্টগ্রামের একটি ছোট রুম থেকে আমি 'চট্টগ্রাম xG' ব্লগ চালু করি বার্নলির চেলসিকে ৩-২ গোলে হারানোর ম্যাচ দিয়ে। চেলসির xG ছিল ২.৩, বার্নলির ০.৯; তবু স্কোরবোর্ড বলল ৩-২। সেদিন আমি লিখেছিলাম, xG বার্নলির ভাগ্য ব্যাখ্যা করছে না — বরং চেলসির রক্ষণভাঙন উন্মোচন করছে। ৫০০ ভিউ আর ১২টি কমেন্ট পাওয়া সেই পোস্ট থেকেই আমার একটি অভ্যাস দাঁড়ায়: প্রতিটি ম্যাচ বিশ্লেষণ শুরু হবে xG আর PPDA দিয়ে, কখনও আখ্যান দিয়ে নয়।

সাত বছর পর, ২০২৪ সালের একটি স্বয়ংক্রিয় বিশ্লেষণ পাইপলাইনে, আমি সম্পূর্ণ ভিন্ন এক ফাঁকের মুখোমুখি হই। প্রথম ধাপের আউটপুট ফিরে আসে নিঃশব্দে খালি — শিরোনাম নেই, সূত্র নেই, তথ্যবিন্দু নেই, কোনো দল, খেলোয়াড় বা ম্যাচের নাম নেই। কেবল একটি ক্ষীণ লেবেল টিকে থাকে: cricket_asia। পাইপলাইনের দ্বিতীয় ধাপ স্পষ্ট ভাষায় জানিয়ে দেয়, এই ইনপুট থেকে কোনো অর্থপূর্ণ বিশ্লেষণ সম্ভব নয়।

যেখানে তথ্য নেই, সেখানে গল্প নয়: ক্রিকেট বিশ্লেষণে ডেটা-অখণ্ডতা ও ব্লকচেইন-প্রমাণের পাঠ

সেই খালি আউটপুটটাই আজ আমার মূল চরিত্র। একজন ডেটা-নির্ভর বিশ্লেষকের সামনে যখন শূন্য ফিল্ড আসে, তখন দুটি পথ খোলা থাকে — একটি সৎ, আরেকটি বিপজ্জনক। সৎ পথ বলে, তথ্য নেই, তাই সিদ্ধান্তও নেই। বিপজ্জনক পথ ফিসফিস করে, ফাঁকটা গল্প দিয়ে ভরে দাও।

যেখানে তথ্য নেই, সেখানে গল্প নয়: ক্রিকেট বিশ্লেষণে ডেটা-অখণ্ডতা ও ব্লকচেইন-প্রমাণের পাঠ

মডার্ন ক্রিকেট বিশ্লেষণ আর একক ম্যাচ-রিপোর্ট নয়। ২০১৭ সালে ঢাকায় প্রথম আলোর উইলস কাপ কাভারেজ দিয়ে লেখা শুরুর সময় আমি ভাবতাম কাজটা কেবল বর্ণনা। আজ এটি একটি শিল্প-প্রক্রিয়া, যা কয়েকটি স্তরে ভাগ হয়ে গেছে। প্রথম স্তরে (ডিকনস্ট্রাকশন) কাঁচা নিবন্ধ থেকে তথ্যবিন্দু, সূত্র, সময়-সংবেদনশীলতা আর সত্তা (দল, খেলোয়াড়, কোচ, ইভেন্ট) বের করে আনা হয়। দ্বিতীয় স্তরে (প্রফেশনাল অ্যানালাইসিস) সেই তথ্যবিন্দুগুলো আটটি মাত্রায় ফেলে বিশ্লেষণ করা হয় — ফরম্যাট ও ম্যাচ, খেলোয়াড়ের টেকনিক ও ডেটা, দলের ল্যান্ডস্কেপ ও র‍্যাঙ্কিং, লিগ ও বাণিজ্যিক ইকোসিস্টেম, নিয়ম ও গভর্ন্যান্স, ঝুঁকি, জন-আখ্যান, আর শিল্প-প্রসারণ।

এই দুই স্তরের মধ্যে একটি অলঙ্ঘনীয় চুক্তি আছে: দ্বিতীয় স্তর প্রথম স্তরের তথ্যবিন্দুর উপর দাঁড়িয়ে থাকে। তথ্যবিন্দু না থাকলে বিশ্লেষণ দাঁড়ায় না — সে ক্ষেত্রে সঠিক আউটপুট হয় একটি সুস্পষ্ট 'অপর্যাপ্ত তথ্য' প্রতিবেদন, কোনো কল্পিত বিশ্লেষণ নয়।

খালি ইনপুট কেন আসে? বাস্তবে এর কয়েকটি চেনা কারণ আছে। সোর্স নিবন্ধটি আসলে খালি ছিল; স্ক্র্যাপিং ব্যর্থ হয়েছে; ফিল্ডগুলো ভুলভাবে ম্যাপ হয়েছে; কিংবা ট্যাক্সোনমি অসামঞ্জস্যপূর্ণ — যেমন কাঙ্ক্ষিত 'Cricket' লেবেলের জায়গায় 'cricket_asia' এসে গেছে। এগুলোর যেকোনো একটি পাইপলাইন ভেঙে দিতে পারে। একটি খালি পেলোড আসলে প্রায়ই বোঝায় উপরের দিকের (আপস্ট্রিম) কোনো এক্সট্রাকশন বা পার্সিং ব্যর্থতা — নিবন্ধটি ঠিকভাবে ইনজেস্ট হয়নি, বা ডিকনস্ট্রাকশন প্রম্পটটি ঠিকভাবে চালানো হয়নি।

এই ভাঙনের stakes কম নয়। ক্রিকেট বিশ্লেষণ আজ নিরপেক্ষ পাঠ নয়; এটি একটি সিদ্ধান্ত-পরিষেবা। নির্বাচক কমিটি স্কোয়াড বাছেন এই ডেটার ভিত্তিতে; অধিনায়ক ফিল্ড সাজান; সম্প্রচারক কমেন্ট্রি সাজান; ফ্যান্টাসি ম্যানেজার আর বাজারের অংশগ্রহণকারীরা নিজেদের সিদ্ধান্ত এই সংখ্যার উপর গড়ে তোলেন। ভিত্তি কাঁপলে পুরো সিদ্ধান্ত-শৃঙ্খল কাঁপে। আমি যে সম্পাদকদের জন্য লিখি — সিলেক্টর, এজেন্ট, কোচ, ব্রডকাস্টার — তাঁরা কেউই 'সম্ভবত ঠিক' ধরনের অনুমান নিয়ে কাজ করতে পারেন না। তাঁদের প্রয়োজন একটি যাচাইযোগ্য নিয়ম, একটি বেঞ্চমার্ক, একটি থ্রেশহোল্ড।

যেখানে তথ্য নেই, সেখানে গল্প নয়: ক্রিকেট বিশ্লেষণে ডেটা-অখণ্ডতা ও ব্লকচেইন-প্রমাণের পাঠ

এখানেই আজকের কেন্দ্রীয় বিতর্ক: তথ্য না থাকলে বিশ্লেষক কী করবেন?

সবচেয়ে বড় ঝুঁকি হলো বানানো (fabrication)। তথ্যবিন্দু না থাকলে, দ্বিতীয় স্তরের যেকোনো আউটপুটে যে খেলোয়াড়, দল বা ম্যাচের নাম আসবে, সেটি হবে উদ্ভাবিত। একটি খালি ইনপুট থেকে একটি পূর্ণাঙ্গ বিশ্লেষণ তৈরি করা প্রযুক্তিগতভাবে সম্ভব, তবে সেটি হবে মিথ্যা। এটাই সবচেয়ে বিপজ্জনক প্রলোভন, কারণ ভালো লেখার দক্ষতা আর সঠিক তথ্যের উপস্থিতি এক জিনিস নয়। একজন দক্ষ লেখক খালি ফাঁককে এত মসৃণভাবে ভরতে পারেন যে পাঠক টেরই পান না কোথায় তথ্য শেষ আর কল্পনা শুরু।

অনুমান আর উদ্ভাবনের মধ্যে একটি স্পষ্ট রেখা টানতে হয়। অনুমান হলো এমন কিছু, যা বিদ্যমান তথ্য থেকে যুক্তিসঙ্গতভাবে নিষ্কাশিত হয় এবং যার একটি আত্মবিশ্বাস-মাত্রা থাকে। উদ্ভাবন হলো এমন কিছু, যার কোনো ভিত্তি নেই, অথচ উপস্থাপন করা হয় নিশ্চিত সত্যের মতো। ২০১৮ বিশ্বকাপে ফ্রান্স আর্জেন্টিনাকে ৪-৩ গোলে হারানোর ম্যাচে আমি দেখেছিলাম, ফ্রান্সের ২.১ xG আর আর্জেন্টিনার ১.৯ xG প্রায় সমান, তবু ফ্রান্স ৬টি শট অন টার্গেট থেকে ৪ গোল পেয়েছিল। সেখানে 'ফ্রান্স সুযোগ তৈরি আর নষ্ট করার দক্ষতায় এগিয়ে ছিল' — এটি অনুমান, যা তথ্য থেকে আসে। আর 'ফ্রান্সের জয় নিশ্চিত ছিল' — এটি উদ্ভাবন, কারণ তথ্য সেটা বলে না। ওই বিশ্লেষণই ছিল আমার প্রথম পেইড কলাম, দ্য ডেইলি স্টারের জন্য ১,২০০ শব্দের লেখা, যার পারিশ্রমিক ছিল ৩,০০০ টাকা। সেটি সম্ভব হয়েছিল কারণ আমি আখ্যানকে নয়, xG-কে প্রশ্ন করেছিলাম।

যাচাই-প্রোটোকল ছাড়া বিশ্লেষণ শুধুই আখ্যান। একটি সুস্থ পাইপলাইনে চারটি ধাপ থাকা উচিত। এক, সূত্র-নিশ্চিতকরণ: প্রতিটি দাবির পেছনে একটি মূল সূত্র আর প্রকাশের পরম তারিখ থাকবে। দুই, ক্রস-চেক: স্বাধীনভাবে যাচাই, সম্ভব হলে একটি রেফারেন্স ডেটাবেসের সঙ্গে মিলিয়ে। তিন, নমুনা-আকার পরীক্ষা: একটি ম্যাচের একটি সংখ্যা কখনও দীর্ঘমেয়াদি সিদ্ধান্তের ভিত্তি হতে পারে না। চার, ত্রুটি-সীমা: প্রতিটি মডেলের একটি ত্রুটির পরিসর থাকবে, এবং সেটি স্পষ্টভাবে জানানো হবে। এই চারটি ধাপ আমার জন্য কোনো আনুষ্ঠানিকতা নয়; ESTJ মনোভাবের একটি বিশ্লেষকের কাছে প্রক্রিয়াটাই সুরক্ষা।

প্রমাণ-শৃঙ্খলার জন্য ব্লকচেইন একটি প্রযুক্তিগত প্রতিশ্রুতি। খেলাধুলার ডেটা-অখণ্ডতার সমস্যাটি মূলে একটি provenance — উৎস-প্রমাণ — সমস্যা। কে কোন ডেটা তৈরি করল, কখন, কোন সংস্করণে, কী পরিবর্তন হলো — এসব যদি একটি টেম্পার-প্রুফ খাতায় (immutable ledger) লিপিবদ্ধ থাকে, তাহলে পিছনের দিকে তাকিয়ে প্রতিটি সংখ্যার জন্ম যাচাই করা যায়। মে ২০২০-তে যখন বুন্দেসলিগা ফাঁকা স্টেডিয়ামে ফিরে আসে, আমি বায়ার্ন মিউনিখের ৫-০ জয়ে দূরত্ব-কাভারেজ (বায়ার্ন ১১৮.৬ কিমি, শালকে ১১২.৩ কিমি) আর PPDA (বায়ার্ন ৬.২, শালকে ১৪.৮) মাপছিলাম। তখন আমি লিখেছিলাম, ফাঁকা স্টেডিয়াম হোম-অ্যাডভান্টেজ প্রায় ০.৩ xG কমিয়ে দেয়। একটি সময়মোহর-সহ, অপরিবর্তনীয় খাতা থাকলে ওই ম্যাপিংটি বছরের পর বছর ধরে পুনঃযাচাই করা যেত — কে তৈরি করল, কোন সংস্করণে, কোন ত্রুটি-পরিসরে। ব্লকচেইনের স্মার্ট কন্ট্রাক্ট কল্পনায়, একটি ডেটা-বিন্দু কখনো নীরবে বদলে যেতে পারত না; প্রতিটি সংশোধনই একটি স্বাক্ষরিত, সময়মোহর-যুক্ত ঘটনা হতো।

তবে প্রমাণ আর সত্য এক নয়। এই পার্থক্যটি না বুঝলে ব্লকচেইন-প্রমাণ একটি মিথ্যা নিরাপত্তা তৈরি করে। এই পয়েন্টে আমি বিস্তারিত আসব পরের অংশে।

নিয়মের গভর্ন্যান্সেই ডেটা-অখণ্ডতার বড় পরীক্ষা হয়। ২০১৯ সালের ওয়ার্ল্ড কাপ ফাইনালে ইংল্যান্ড আর নিউজিল্যান্ডের স্কোর টাই হয়েছিল, সুপার ওভারও টাই, শেষে বাউন্ডারি-গণনায় ইংল্যান্ড চ্যাম্পিয়ন হয়। সেটি ছিল একটি নিয়ম-কাঠামোর সিদ্ধান্ত, খেলার পারফরম্যান্সের নয়। একইভাবে ডিএলএস (ডাকওয়ার্থ-লুইস-স্টার্ন) পদ্ধতি বৃষ্টি-প্রভাবিত ম্যাচে ফলাফল নির্ধারণ করে, আর 'মানকাড' নিয়ে বিতর্ক বছরের পর বছর নিয়ম-পরিবর্তনের দিকে নিয়ে গেছে। ডিআরএস (ডিসিশন রিভিউ সিস্টেম) আম্পায়ারিং সিদ্ধান্তকে প্রশ্ন করার একটি প্রাতিষ্ঠানিক পথ তৈরি করেছে। এই নিয়মগুলো যাচাই না করে কেউ যদি কেবল 'ফলাফল' থেকে সিদ্ধান্ত টানে, তার বিশ্লেষণ ভুল দিকে যায় — কারণ ফলাফলের পেছনে একটি কৃত্রিম, নিয়ম-নির্ধারিত রেখা লুকিয়ে থাকে।

বাণিজ্যিক প্রসারণটি এই অখণ্ডতার উপর নির্ভরশীল। সম্প্রচার-স্বত্বের মূল্য, ফ্র্যাঞ্চাইজি-মূল্যায়ন, খেলোয়াড়ের বেতন, নিলামের দাম — সবই নির্ভর করে ডেটার বিশ্বাসযোগ্যতার উপর। আইপিএল নিলামের মতো ব্যবস্থায় একটি খেলোয়াড়ের দাম নির্ধারিত হয় অতীতের পারফরম্যান্স-ডেটার ভিত্তিতে; যদি সেই ডেটা অবিশ্বস্ত হয়, তবে নিলামের দামও ভুলভাবে নির্ধারিত হয়। আর যদি বিশ্লেষণী সংখ্যা অবিশ্বস্ত হয়, তবে ফ্যান্টাসি বাজার, বাজি-বাজার আর মূল্যায়ন মডেল সব একই ত্রুটি বহন করে। এই ত্রুটি সবচেয়ে বেশি আঘাত হানে দক্ষিণ এশিয়ার ক্রিকেট-হৃদয়ভূমিতে, যেখানে কোটি কোটি মানুষ ফ্যান্টাসি আর বিশ্লেষণের উপর নিজেদের আবেগ বিনিয়োগ করেন।

যুব-সম্ভাবনার মূল্যায়নে এই ত্রুটি আরও তীব্র। ট্রান্সফার-মার্কেট মডেলগুলো তরুণ সম্ভাবনাকে অতিরিক্ত মূল্য দেয়, অথচ ড্রেসিং-রুমের রসায়ন বা দলের অভ্যন্তরীণ ভারসাম্যকে কম গুরুত্ব দেয়। একটি ১৯ বছর বয়সী খেলোয়াড়ের এক মৌসুমের উজ্জ্বল পরিসংখ্যান প্রায়ই একটি পূর্ণাঙ্গ দল-গঠনের চেয়ে বেশি দাম পেয়ে যায়। এখানেও নমুনা-আকার আর প্রেক্ষাপট-পরীক্ষা ছাড়া সিদ্ধান্ত ঝুঁকিপূর্ণ। আমি ২০২৩ সালে নিজের কেরিয়ারের এক স্মৃতিকথা লেখার সময় ফিরে দেখেছিলাম, প্রথম দিকের ডেস্ক-সাংবাদিকতা থেকে বিশ্লেষণী লেখায় যাওয়ার পথে সবচেয়ে বড় শিক্ষা ছিল এই: তথ্য কী বলে, আর তথ্য কী বলে না — এই দুটির মধ্যে পার্থক্য বোঝা।

আটটি বিশ্লেষণী মাত্রার প্রতিটিই খালি ইনপুটে ভেঙে পড়ে, আর সেটাই শিক্ষণীয়। ফরম্যাট-মাত্রা জানতে চায় টেস্ট, ওডিআই, টি-টোয়েন্টি নাকি দ্য হান্ড্রেড; খালি ইনপুটে এই প্রশ্নের উত্তর নেই। খেলোয়াড়-মাত্রা চায় গড়, স্ট্রাইক রেট, ইকোনমি, সিচুয়েশনাল স্প্লিট; কেউ নাম-না-থাকলে কিছুই বলা যায় না। দল-মাত্রা চায় আইসিসি র‍্যাঙ্কিং, হোম-অ্যাওয়ে প্রোফাইল, স্কোয়াড-গঠন; সত্তা না থাকলে অসম্ভব। লিগ-মাত্রা চায় সম্প্রচার-মূল্য, ফ্র্যাঞ্চাইজি-মূল্যায়ন, বেতন; কোনো লিগ চিহ্নিত না হলে অর্থহীন। গভর্ন্যান্স-মাত্রা চায় ক্ষমতা-বণ্টন, নিয়ম-বিতর্ক, অখণ্ডতা; কিছুই উল্লেখ না থাকলে কিছুই মূল্যায়ন করা যায় না। ঝুঁকি-মাত্রার ছয়টি ক্যাটাগরি (স্পোর্টিং, পার্সোনেল, বাণিজ্যিক, নিয়ম-অখণ্ডতা, জনমত, সিস্টেমিক) কোনো সত্তা ছাড়া ফাঁকা। জন-আখ্যান-মাত্রা চায় প্রত্যাশা-ফাঁক আর অনুভূতি-সূচক; আখ্যান চিহ্নিত না হলে অসম্ভব। আর প্রসারণ-মাত্রা চায় আপস্ট্রিম-মিডস্ট্রিম-ডাউনস্ট্রিম প্রভাব; তথ্যবিন্দু ছাড়া কোনো প্রভাব টানা যায় না।

এই আটটি মাত্রার সামষ্টিক পাঠটি স্পষ্ট: শূন্যতা একটি সৎ উত্তর, আর কল্পনা একটি অসৎ উত্তর। যখন বিশ্লেষণ মডেল আর মাঠের ফলাফল আলাদা হয় — 'xG ম্যাপ বলল ২.৭, কিন্তু বার্নলি' — তখন ফাঁকটাই গল্প, মডেল ছেড়ে দেওয়ার কারণ নয়। কিন্তু যখন ইনপুটই শূন্য, তখন কোনো মডেল নেই যাকে প্রশ্ন করা যায়; তখন একমাত্র সৎ কাজ হলো বিশ্লেষণ থামানো এবং উপরের স্তরে ফিরে গিয়ে তথ্যবিন্দু সরবরাহ করা।

এখন আসি সেই অস্বস্তিকর অংশে, যা এই প্রবন্ধের মূল যুক্তির বিরুদ্ধেও যায়।

ব্লকচেইন প্রমাণ করে 'কে বলেছে', সত্য প্রমাণ করে 'কেন সত্য'। একটি দাবি যদি অপরিবর্তনীয়ভাবে লিপিবদ্ধ হয়, তবু সেটি মিথ্যা হতে পারে। প্রমাণ আর বৈধতা — authenticity আর validity — দুটি ভিন্ন জিনিস। একটি ব্লকচেইনে একটি ভুল xG মান চিরকালের জন্য লিপিবদ্ধ হতে পারে, এবং সেটি আরও বিপজ্জনক, কারণ পাঠক ভাববেন সংখ্যাটি যেহেতু যাচাইযোগ্য খাতায় আছে, তাই এটি নিশ্চয়ই সঠিক। আমাদের যাচাই-প্রোটোকল তাই দুই স্তরে হওয়া উচিত: এক, উৎস-প্রমাণ (কে, কখন, কোন সংস্করণ), দুই, যুক্তি-পরীক্ষা (সংখ্যাটি প্রেক্ষাপটে দাঁড়ায় কি না)।

খালি পাইপলাইন প্রমাণ করে অখণ্ডতার সমস্যা, কিন্তু পূর্ণ পাইপলাইন নিশ্চয়তা দেয় না। একটি তথ্যে ভরা পাইপলাইনও পক্ষপাত বহন করতে পারে — কে মাপা হচ্ছে, কোন পরিসংখ্যান গুরুত্ব পাচ্ছে, কোন দল কম দেখা হচ্ছে। সম্পূর্ণতা আর শুদ্ধতা এক নয়। এ কারণেই খালি ইনপুটের শিক্ষাটি কেবল 'তথ্য হারানো' নয়, বরং 'তথ্যকে প্রশ্ন না করার' বিপদেরও।

আর একটি বিপদ: শাস্তির আবেগ। তথ্য না থাকলে দুর্বল বিশ্লেষক হয় চুপ করেন, নয়তো অভিযোগে ভর দেন। দ্বিতীয়টি আরও ক্ষতিকর, কারণ সন্দেহের নামে নির্মাণ-বিরোধিতা কোনো যাচাই নয়। খালি ফিল্ড আমাকে বাধ্য করে স্বীকার করতে: আমি জানি না। আর 'আমি জানি না' বলার সততাই একজন বিশ্লেষকের সবচেয়ে শক্তিশালী হাতিয়ার।

খালি ফিল্ডের প্রকৃত পাঠ ভবিষ্যতের দিকে নির্দেশ করে। শূন্যতা নিজেই একটি সতর্কবার্তা, এবং যারা সেটি পড়তে জানেন, তারাই সিদ্ধান্ত-পরিষেবার পরবর্তী রাউন্ডে এগিয়ে থাকবেন।

প্রশ্নটি তাই আর 'ডেটা কতটা নাটকীয়' নয়; প্রশ্নটি হলো, 'ডেটার প্রমাণ-শৃঙ্খল কতটা শক্ত।' যারা প্রতিটি সংখ্যার পেছনে উৎস, পরম তারিখ আর ত্রুটি-সীমা রাখবেন, তারাই পরের মৌসুমে নির্বাচক, অধিনায়ক আর বাজারের কাছে বিশ্বাসযোগ্য থাকবেন। আর যারা ফাঁক গল্প দিয়ে ভরবেন, তাদের বিশ্লেষণ প্রথম কঠিন প্রশ্নেই ভেঙে পড়বে।

সে হিসেবে, সবচেয়ে মূল্যবান মেট্রিকটি হয়তো কোনো খেলোয়াড়ের স্ট্রাইক রেট নয় — বরং বিশ্লেষকের নিজের বিশ্বাসযোগ্যতার ধারাবাহিকতা। পরের রাউন্ডে কে জিতবেন? সম্ভবত সেই বিশ্লেষক, যিনি খালি ফিল্ডের সামনে বলতে পারেন: এখানে আমার কিছু বলার নেই, ততক্ষণ — যতক্ষণ না তথ্য আসছে।

সংশ্লিষ্ট খেলোয়াড়গণ