১. ডিসকাভারি — লোকাল LLM কি আমার টিমের জন্য সিদ্ধান্ত নেওয়ার মতো?¶
সময়: ১ দিন, ১ জন ইঞ্জিনিয়ার। প্রোডাকশনে কোনো কোড নেই। বের-হওয়ার মানদণ্ড: লিখিত উত্তর — "হ্যাঁ, ওয়ার্কফ্লো X-এর জন্য, হার্ডওয়্যার Y-তে, রিস্ক Z সহ" — অথবা লিখিত "না, আর কারণটা হলো"।
বেশিরভাগ ব্যর্থ লোকাল-LLM প্রজেক্ট ব্যর্থ হয় কোনো কোড লেখার আগেই। টিম ভলো ওয়ার্কফ্লো বেছে নিয়েছে, ভলো হার্ডওয়্যার টার্গেট করেছে, অথবা ভলো মডেল সাইজ নিয়েছে। ডিসকাভারি হলো একদিনের প্রি-মর্টেম — খারাপ আইডিয়াগুলো সস্তায় মেরে ফেলা, ৬ সপ্তাহের পাইলট সময় নষ্ট করার আগে।
সফল ডিসকাভারির সবচেয়ে গুরুত্বপূর্ণ অংশটা হলো লেখা। আপনার উত্তরটা এক পৃষ্ঠার মেমো আকারে থাকবে — যাতে ৬ মাস পরে, যখন কেউ জিজ্ঞেস করবেন "আমরা কেন এই ওয়ার্কফ্লো বেছে নিয়েছিলাম?", সেই উত্তর মেমোতে থাকে। মৌখিক সিদ্ধান্ত ৬ মাস পরে কেউ মনে রাখে না; লিখিত সিদ্ধান্ত ৬ মাস পরেও বিতর্কের জায়গায় থাকে।
আপনার কাছে যদি আগে থেকেই কাজ করা লোকাল-LLM প্রোটোটাইপ থাকে, এই পেজটা স্কিপ করে বিল্ড-এ যান। একটা টিম প্রোডাকশনে আছে আর সম্প্রসারণ করতে চাইলে, স্কেল-এ যান।
ডিসকাভারি যা না¶
- এটা রিসার্চ প্রজেক্ট না। আপনি মডেল ট্রেইন করছেন না।
- এটা বেঞ্চমার্ক না। আপনি LM Arena চালাচ্ছেন না।
- এটা প্রোকিউরমেন্ট এক্সারসাইজ না। আপনি GPU কিনছেন না।
এটা হলো ১ জন ইঞ্জিনিয়ার, ১ দিন, ১টা ওয়ার্কফ্লো, ১টা ল্যাপটপ, ১টা পরিষ্কার উত্তর।
ডিসকাভারি যেটা হলে ব্যর্থ হয় সেটা হলো — টিম ৫ জনের একটা সপ্তাহব্যাপী "research sprint"-এ বসে, ১০টা মডেল ৪টা ডেটাসেটে চালায়, শেষে ২০ পৃষ্ঠার পিডিএফ বানায়, আর সেই পিডিএফ কেউ পড়ে না। ১ দিনের ফোকাসড সিদ্ধান্ত ৫ জনের ১ সপ্তাহের গবেষণার চেয়ে বেশি কাজে আসে।
আরেকটা সাধারণ ভুল হলো "আমরা একটু eval-ও চালাই আর একটু prompt-ও লিখি" — এটা ডিসকাভারি না, এটা পাইলট। ডিসকাভারিতে eval চালানো যাবে, কিন্তু সেটা হবে ১০–২০টা উদাহরণের ৪-ঘণ্টার মূল্যায়ন, ৫০০টা উদাহরণের ১-সপ্তাহের বেঞ্চমার্ক না।
ধাপ ১ — একটা আসল ওয়ার্কফ্লো বাছুন (৩০ মিনিট)¶
জেনেরিক টাস্ক বাছবেন না ("ডকুমেন্ট সামারাইজ করেন")। এমন একটা ওয়ার্কফ্লো বাছুন যেটা আগে থেকেই আছে, লোপে একজন মানুষ আছে, আর পরিমাপযোগ্য সম্ভাব্য সফলতা তৈরি করছে।
ভালো ক্যান্ডিডেট:
| ওয়ার্কফ্লো | সম্ভাব্য সিগন্যাল | লোকাল LLM-এ কেন ফিট করে |
|---|---|---|
| ISP টায়ার-১ টিকিট ট্রায়াজ | গড়ে ২ মিনিট হ্যান্ডেল টাইম, ৪০% ভলো রাউট | কঠোর টেমপ্লেট, কম সৃজনশীলতা |
| ব্যাংক IT পাসওয়ার্ড-রিসেট ট্রায়াজ | ৩০% টিকিট ডুপ্লিকেট | কঠোর টেমপ্লেট, উচ্চ ভলিউম |
| কারখানার শিফট হ্যান্ডওভার | হাতে লেখা নোট, পরস্পর হারিয়ে যায় | ফ্রি-ফর্ম সামারি, কোনো PII নেই |
| নেটওয়ার্ক ডিভাইস কনফিগ রিভিউ | ইঞ্জিনিয়ার দিনে ৫০টা কনফিগ দেখেন | বাউন্ডেড ইনপুট, নির্ধারিত আউটপুট |
| ফিল্ড-টেকনিশিয়ান রিপোর্ট ক্লিনআপ | ডিক্টেশন, গ্রামার ত্রুটি, অসংগত পরিভাষা | ফরম্যাট-নিয়ন্ত্রিত, কোনো ডেটা-রেসিডেন্সি সমস্যা নেই |
খারাপ ক্যান্ডিডেট: ওপেন-এন্ডেড প্রশ্নোত্তর, সৃজনশীল লেখা, এমন কিছু যেখানে মডেলটাই প্রোডাক্ট (সহায়ক না)।
উত্তরটা এক বাক্যে লেখুন: "আমি পরীক্ষা করছি একটা লোকাল LLM কি [ওয়ার্কফ্লো] কাজটা [মানের বার]-এ করতে পারে ক্লাউডে ডেটা না পাঠিয়ে।"
এক বাক্যে না লিখতে পারলে আপনি ওয়ার্কফ্লোটা ঠিকমতো বুঝছেন না। "আমরা AI চেষ্টা করতে চাই" এক বাক্য না, এটা একটা ইচ্ছা। "আমরা NOC-এর টিকিট ট্রায়াজের গড় হ্যান্ডেল টাইম ২ মিনিট থেকে ৩০ সেকেন্ডে নামাতে চাই" এক বাক্য, এটা একটা লক্ষ্য। লক্ষ্য ছাড়া ডিসকাভারি হয় না।
ধাপ ২ — ডেটা রেসিডেন্সির গল্পটা সংক্ষেপ-চেক করেন (১৫ মিনিট)¶
আপনার ডেটা রেসিডেন্সি উদ্বেগ আসল হলে উত্তর প্রায় সবসময় "হ্যাঁ, লোকাল LLM বিবেচনা করার মতো"। যদি নাটক হয়, উত্তর প্রায় সবসময় "হোস্টেড API ব্যবহার করেন আর দ্রুত শিপ করেন"।
লিগ্যাল/সিকিউরিটি টিমকে তিনটা প্রশ্ন জিজ্ঞেস করেন, লিখিত:
- কোন ক্লাসের ডেটা আমাদের নেটওয়ার্কের বাইরে যেতে পারে না? (গ্রাহক PII, নেটওয়ার্ক ল—, ইন্টারনাল ডক, সোর্স কোড, ফাইন্যান্সিয়াল ডেটা...)
- কোন ক্লাস DPA-র অধীনে তৃতীয়-পক্ষ API-তে যেতে পারে? (প্রায়ই: অ্যানোনিমাইজড, ডি-আইডেন্টিফাইড, অথবা পাবলিক)
- বাজেটের খরচ কত, টাকা আর সময়ে?
(১) যদি আপনার ওয়ার্কফ্লো কভার করে আর (৩) নন-ট্রিভিয়াল হয়, লোকাল LLM কাঠামোগতভাবে হাইব্রিড গেটওয়ে বানানোর চেয়ে সস্তা। (২) যদি আপনার ওয়ার্কফ্লো আরামে কভার করে, হোস্টেড API সম্ভবত দ্রুত আর যথেষ্ট ভালো — আর আপনার হোমপেজের হাইব্রিড-গেটওয়ে নোট আবার পড়া উচিত।
এই তিন প্রশ্নের উত্তর লিখিত না আনলেন ডিসকাভারি আটকে যাবে। "লিগ্যাল বলেছে 'সাবধানে দেখো'" মৌখিক উত্তর কোনো উত্তর না — এটা ৬ মাস পরে "আপনি কেন আমাদের জিজ্ঞেস করেননি?" প্রশ্নের জন্ম দেয়।
একটা সাধারণ ভুল হলো এই ধাপটা ৩০ মিনিটের বেশি নেওয়া। ডেটা রেসিডেন্সি বিশ্লেষণ একটা ডিসকাভারি ফেজ, বিল্ড বা স্কেল ফেজ না। ৩০ মিনিটে উত্তর না পেলে সেটা লাল পতাকা — হয়তো ওয়ার্কফ্লোটা এত বড় যে সেটা ১ দিনের ডিসকাভারির জন্য না, বরং ১-সপ্তাহের পাইলট। পাইলট-এ ডেটা রেসিডেন্সি বিশ্লেষণের সময় থাকে, ডিসকাভারিতে নেই।
ধাপ ৩ — হার্ডওয়্যার স্যানিটি-চেক করেন (১৫ মিনিট)¶
সবচেয়ে সস্তা লোকাল-LLM ভল হলো এমন মডেল কেনা যেটা আপনার হার্ডওয়্যারে ফিট হয় না।
| মডেল সাইজ (Q4 quant) | প্রায় RAM দরকার | যেখানে ফিট করে |
|---|---|---|
| ১.৫B প্যারাম (Qwen 2.5) | ~৪ GB | যেকোনো ডেভেলপার ল্যাপটপ |
| ৪B প্যারাম (Gemma 3) | ~৬ GB | বেশিরভাগ অফিস ল্যাপটপ |
| ৭B প্যারাম | ~৯ GB | আধুনিক ওয়ার্কস্টেশন |
| ১৩B+ প্যারাম | ১৬+ GB | ডেডিকেটেড GPU বক্স |
ISP ক্লাসিফায়ার আর SLA অ্যাসিস্ট্যান্ট রেফারেন্স মডিউল ডিফল্টভাবে Qwen 2.5 ১.৫B দিয়ে শিপ হয় ঠিক এই কারণে — NOC ইঞ্জিনিয়ারের আগে থেকে থাকা ল্যাপটপে ফিট হয়। আপনার ওয়ার্কফ্লো যদি ১৩B দাবি করে আর আপনার কাছে GPU বক্স নেই, আপনি ১৫ মিনিটে ডিসকাভারি করেছেন, ৬ সপ্তাহে না।
একটা কঠিন সত্য: বেশিরভাগ ক্লাসিফায়ার/এক্সট্রাকশন ওয়ার্কফ্লোতে ১.৫B আর ৭B-এর মধ্যে কোয়ালিটির পার্থক্য ৫% এর কম। ১.৫B ৭B-এর চেয়ে ৪–৫ গুণ দ্রুত, ৪–৫ গুণ সস্তা। ছোট মডেল দিয়ে শুরু করেন, ৭B দরকার হলে পরে আপগ্রেড করেন।
একটা লুকানো খরচ: মডেল RAM-এ ফিট হলেই যথেষ্ট না — আপনার প্রসেসরের কোন সংস্করণ (AVX, AVX-512, Metal) আছে সেটাও ম্যাটার করে। Q4 quant ইনফারেন্স ১.৫B-তে AVX-512 সাপোর্ট ছাড়া CPU-তে ধীর হতে পারে। পুরোনো ThinkPad-এ Q4-১৩B চালানো ২০ টোকেন/সেকেন্ড, আর M2 MacBook-এ একই মডেল ৮০ টোকেন/সেকেন্ড। হার্ডওয়্যার চেক মানে শুধু RAM না, কোর আর্কিটেকচারও।
ধাপ ৪ — সাফল্যের বার আগে থেকে বাছাই করেন (১৫ মিনিট)¶
একটা প্রম্পট চালানোর আগেই কাগজে বারটা লেখুন। বার তিনটা জিনিস হতে হবে:
- পরিমাপযোগ্য। "৯৫% টিকিট সঠিক লেবেল পায়" — "ভালো দেখায়" না।
- আজকের সাথে তুলনীয়। "এই সপ্তাহের টিকিটে ৮৮% মানব বেসলাইনের সমান অ্যাকুরেসি" — "নিখুঁত" না।
- সীমাবদ্ধ। দুই সপ্তাহ, একটা ওয়ার্কফ্লো, একটা ডেটাসেট। "দেখা যাক" না।
বার পরিমাপযোগ্য না হলে পাইলট কোনোদিন শেষ হবে না। বার আজকের সাথে তুলনীয় না হলে আপনি কোনোদিন জানবে না পাস করেছেন কিনা। বার সীমাবদ্ধ না হলে পাইলট ৬ মাস চলবে আর কেউ জানবে না কেন।
ভালো বার এরকম দেখায়:
- ক্লাসিফায়ার: "গত ২ সপ্তাহে আসা ১০০০ টিকিটে ৯০% ক্যাটেগরি অ্যাগ্রিমেন্ট, ৮৫% প্রায়োরিটি অ্যাগ্রিমেন্ট, বেসলাইনের সাথে।"
- এক্সট্রাক্টর: "৫০০ ইনভয়েসে ৯৫% ফিল্ড ভ্যালিড, ১০% ক্ষেত্রে রিভিউ-এর দরকার হয়।"
- সামারাইজার: "২০০ রিপোর্টে ৭০% সারমর্ম ১-বাক্যে বেসলাইনের সাথে মিলে।"
ভালো বার লিখিত না হলে পাইলটের শেষে আপনি "ভালো দেখাচ্ছে" বলবে, যেটা কোনো সিদ্ধান্ত না। সিদ্ধান্তহীনতা হলো পাইলটের সবচেয়ে ব্যয়বহুল আউটপুট।
ধাপ ৫ — একদিনের মূল্যায়ন চালান (৪ ঘণ্টা)¶
LM Studio ইনস্টল করেন, Qwen 2.5 ১.৫B (অথবা আপনার বার পূরণ করে এমন সবচেয়ে ছোট মডেল) ডাউনলোড করেন, আর গত সপ্তাহের ২০–৫০টা আসল উদাহরণে ওয়ার্কফ্লো চালান।
ডকুমেন্ট করুন:
- শীর্ষ ৩ ব্যর্থতার ধরন। "IP অ্যাড্রেস হ্যান্ডেলসিং করেন", "১০% ক্ষেত্রে ভলো রাউট করে", "১২ সেকেন্ড/রেসপন্সে অনেক ধীর"।
- শীর্ষ ১ অপ্রত্যাশিত সাফল্য। "বলা না হলেও আসলে SLA প্রায়োরিটি ঠিক করেছে"।
- বারটা অর্জনযোগ্য কিনা — এক বাক্যে। "অর্জনযোগ্য" বা "অর্জনযোগ্য না" বা "GPU বক্সে বড় মডেল দিয়ে অর্জনযোগ্য"।
ধাপ ৫-এ আপনি কোনো কেনার সিদ্ধান্ত নিচ্ছেন না। আপনি ধাপ ৬-এ লেখার জন্য একটা বাক্য জোগাড় করছেন। মূল্যায়ন ডকুমেন্ট না করলে আপনি ৩ দিন পরে ভুলে যাবেন আপনি কোন ভল্টা দেখেছিলেন।
মূল্যায়নের সবচেয়ে সাধারণ ভুল হলো খুব কম উদাহরণ ব্যবহার করা। ২০টা উদাহরণ খুব কম — সেটা দিয়ে আপনি একটা মডেলের সক্ষমতা বোঝেন, কিন্তু ১০০০-টিকিটের ওয়ার্কফ্লোতে সেটা ভলিউমে কেমন হবে সেটা বোঝেন না। আবার ৫০০০ উদাহরণও একদিনের ডিসকাভারিতে বেশি — সেটা পাইলট-এর কাজ। ৫০–২০০ উদাহরণ হলো সোনার মাঝামাঝি।
আরেকটা ভুল হলো বিভিন্ন ধরনের উদাহরণ ব্যবহার না করা। আপনার ৫০টা উদাহরণ যদি সব সহজ হয়, তাহলে মডেলকে সহজ-এ ভালো বলে প্রমাণ করছেন, কিন্তু বাস্তবে ওয়ার্কফ্লোতে কঠিন উদাহরণও আসে। ১০টা কঠিন, ২০টা মাঝারি, ২০টা সহজ — এই মিশ্রণটাই বাস্তবসম্মত।
ধাপ ৬ — উত্তরটা লেখুন (৩০ মিনিট)¶
দিনটা শেষ করেন এক পৃষ্ঠার মেমো দিয়ে। মেমো তিনটা সেকশন:
- ওয়ার্কফ্লো (ধাপ ১ থেকে এক বাক্য)
- হ্যাঁ / না / হ্যাঁ-কিন্তু (এক-বাক্যের রায়)
- পরের ধাপ ("পাইলট-এ যান", "মেরে ফেলো", "অন্য ওয়ার্কফ্লো চেষ্টা করেন", "বড় মডেল আনো" — যেটা)
মেমোটাই ডেলিভারেবল। টিম লিড বা স্পন্সর যদি মেমোতে সাইন না করে, প্রজেক্ট পাইলটে যায় না। ডিসকাভারির পর পয়েন্টটা এটাই।
সাইন কে করবেন? সাধারণত টিম লিড + একজন স্পন্সর (ম্যানেজার, প্রোডাক্ট ওনার)। স্পন্সর ছাড়া সাইন পাইলট চলাকালীন দিক পরিবর্তনের ঝুঁকি বাড়ায়। স্পন্সর ছাড়া "হ্যাঁ" মানে একজন ইঞ্জিনিয়ারের একার সিদ্ধান্ত, যেটা ৩ মাস পরে পুরো প্রজেক্টকে বাতিল করতে পারে।
ডিসকাভারিতে যা করবেন না¶
- CI/CD পাইপলাইন সেট আপ করবেন না। আপনি এখনো বিল্ডে নেই।
- ৬টা মডেল বেঞ্চমার্ক করবেন না। সবচেয়ে ছোট যেটা সম্ভব সেটা বাছুন আর মাপো।
- পুরো টিমকে ইনভলভ করবেন না। ১ জন ইঞ্জিনিয়ার, ১ দিন।
- মেমো না লিখে স্কিপ করবেন না। "ঠিকঠাক হচ্ছে" মেমো না।
ডেলিভারেবল চেকলিস্ট¶
- একটা ওয়ার্কফ্লো বাছা, লিখিত
- লিগ্যাল/সিকিউরিটি ডেটা রেসিডেন্সি প্রশ্নের উত্তর দিয়েছে
- হার্ডওয়্যার টার্গেট কনফার্ম (অথবা আপগ্রেড)
- সাফল্যের বার নিচে লেখা, পরিমাপযোগ্য
- ২০–৫০ উদাহরণের মূল্যায়ন চালানো, শীর্ষ ৩ ব্যর্থতার ধরন ডকুমেন্টেড
- এক পৃষ্ঠার মেমো হ্যাঁ / না / হ্যাঁ-কিন্তু সহ
- স্পন্সর সাইন-অফ (মৌখিক বা লিখিত)
মেমো সাইন হলে আপনি ডিসকাভারির প্রশ্নের উত্তর দিয়েছ। পাইলট-এ যান।