সোলার প্যানেলের জন্য থার্মাল ইমেজিং: কীভাবে SESPNet ইনফ্রারেডে প্রতিটি হটস্পট ধরে
সূচিপত্র
পণ্য পরিচিতি
একটি সোলার ফার্মে কয়েক হাজার থেকে কয়েক মিলিয়ন মডিউল থাকতে পারে। দিনের পর দিন তারা তাপ, বাতাস, বালি, বৃষ্টি এবং তুষারে পড়ে থাকে, তাই তারা বিভিন্ন ধরনের সমস্যা সংগ্রহ করে তা আশ্চর্যজনক নয়। সবচেয়ে সাধারণ এবং সবচেয়ে বিপজ্জনক সমস্যা হল হটস্পট।
হটস্পট হল একটি মডিউলের একটি ছোট অংশ যা অস্বাভাবিকভাবে গরম চলে। সবচেয়ে ভালো অবস্থায় এটি আপনার পাওয়ার আউটপুট কমিয়ে দেয়। সবচেয়ে খারাপ অবস্থায় এটি ব্যাকশিট পুড়িয়ে ফেলে এবং আগুন শুরু করে, পুরো প্ল্যান্টকে ঝুঁকিতে ফেলে। সমস্যা হল, মডিউলগুলি প্রান্ত থেকে প্রান্তে প্যাক করা থাকে। হ্যান্ডহেল্ড যন্ত্র দিয়ে একে একে পরীক্ষা করার জন্য ক্রু পাঠানো ধীর এবং অনেক কিছু মিস করে। তাই ইনফ্রারেড থার্মোগ্রাফি এবং ডিপ লার্নিং-এর জুটি স্পটলাইটে এসেছে।
একটি মডিউলের দিকে একটি ইনফ্রারেড ক্যামেরা নির্দেশ করুন, এর তাপমাত্রা বিস্তারকে হিট ম্যাপ হিসাবে ক্যাপচার করুন, তারপর একটি প্রশিক্ষিত নিউরাল নেটওয়ার্ককে আপনার জন্য সেই মানচিত্র পড়তে দিন এবং চিহ্নিত করুন কোথায় গরম এবং কতটা গরম। সহজ শোনায়। কিন্তু এটি ক্ষেত্রে কাজ করানো আরেকটি গল্প। ইনফ্রারেড ছবিগুলির তিনটি অন্তর্নির্মিত ত্রুটি রয়েছে যা সাধারণ অ্যালগরিদমকে ব্যর্থ করে: কম রেজোলিউশন, wildly ভিন্ন ত্রুটির আকার এবং জটিল ব্যাকগ্রাউন্ড।
SESPNet (সিম্যান্টিক এনহ্যান্সমেন্ট এবং স্কেল পারসেপশন নেটওয়ার্ক) নামে একটি নতুন পদ্ধতি সরাসরি সেই তিনটি ত্রুটির পিছনে যায়। এর সংখ্যা শক্ত: 92.1% মিন অ্যাভারেজ প্রিসিশন, 62.4 ফ্রেম প্রতি সেকেন্ড, এবং এটি একটি পাম-আকারের এম্বেডেড ডিভাইসে রিয়েল টাইমে চালানোর জন্য যথেষ্ট ছোট। এই টুকরোটি ব্যাখ্যা করে যে এটি কীভাবে একটি নিস্তেজ ধূসর ইনফ্রারেড ফ্রেম থেকে প্রতিটি হটস্পট বের করে আনে।
প্রথমত, হটস্পট কেন গুরুত্বপূর্ণ। একটি পিভি মডিউল অনেকগুলি সেল সিরিজে সংযুক্ত থাকে। যদি একটি সেল ছায়া, মাইক্রো-ক্র্যাক বা ময়লার কারণে আউটপুট হারায়, তবে এটি কারেন্ট সরবরাহ করা বন্ধ করে দেয় এবং একটি রোধকের মতো কাজ করতে শুরু করে, অন্যান্য সেল থেকে আসা কারেন্টকে তাপে রূপান্তরিত করে এবং নিজের ভিতরে পুড়িয়ে ফেলে। সেই একটি সেল পুরো স্ট্রিংয়ের জন্য তাপের উৎস হয়ে ওঠে, তার প্রতিবেশীদের চেয়ে কয়েক ডিগ্রি বেশি গরম চলে। হালকা ক্ষেত্রে স্ট্রিংয়ের আউটপুট কমে যায়। গুরুতর ক্ষেত্রে সময়ের সাথে সাথে এনক্যাপসুল্যান্ট নষ্ট হয়ে যায়, ব্যাকশীট পুড়ে যায় এবং এমনকি আগুনও লাগতে পারে। হটস্পটগুলি তাড়াতাড়ি খুঁজে বের করা এবং দ্রুত মোকাবেলা করা একটি কাজ যা পিভি অপারেশন এড়াতে পারে না।

চিত্র 1: ছাদে মাউন্ট করা সোলার কালেক্টর মডিউল, বছরের পর বছর বাইরে উন্মুক্ত, যেখানে স্থানীয় তাপমাত্রা বৃদ্ধি হটস্পট তৈরি করে।

চিত্র 2: পিভি মডিউল ত্রুটির জন্য ইনফ্রারেড তাপ সনাক্তকরণের পাঁচ-পদক্ষেপ কর্মপ্রবাহ, তাপমাত্রা ক্যাপচার থেকে ত্রুটিপূর্ণ প্যানেল চিহ্নিত করা পর্যন্ত।
প্রযুক্তিগত প্যারামিটার
হটস্পট সনাক্তকরণের জন্য কেন ইনফ্রারেড অপরিহার্য
এই অ্যালগরিদম বোঝার জন্য, মৌলিক বিষয়গুলি দিয়ে শুরু করুন: কেন একটি দৃশ্যমান-আলো ক্যামেরা লুকানো পিভি ত্রুটির জন্য কাজ করবে না, এবং কেন ইনফ্রারেডই একমাত্র উপায়।
দৃশ্যমান-আলো ইমেজিং হল সাধারণ ফটোগ্রাফি। উচ্চ রেজোলিউশন, সমৃদ্ধ বিবরণ, পৃষ্ঠের ফাটল, স্ক্র্যাচ এবং ময়লা সনাক্ত করার জন্য ভাল, যা আপনি দেখতে পারেন। কিন্তু এর একটি মারাত্মক সীমাবদ্ধতা রয়েছে। এটি কেবল চেহারা পড়ে, তাপমাত্রা নয়। একটি মডিউলের ভিতরে একটি মাইক্রো-ক্র্যাক বা ঠান্ডা সোল্ডার জয়েন্ট প্রায়শই প্রথম দিকে এর চেহারা পরিবর্তন করে না, তবুও এটি সেই স্থানে কারেন্ট ব্লক করে এবং এটিকে গরম করে। দৃশ্যমান-আলো ক্যামেরাগুলি এই তাপীয় ত্রুটিগুলির বিরুদ্ধে অসহায়, এবং রাতে বা কম আলোতে এগুলি অকেজো।
ইনফ্রারেড একটি ভিন্ন পথ নেয়। পরম শূন্যের উপরে যেকোনো বস্তু ইনফ্রারেড বিকিরণ করে, এবং এটি যত গরম, বিকিরণ তত শক্তিশালী। একটি ইনফ্রারেড ক্যামেরা সেই বিকিরণ ক্যাপচার করে এবং অদৃশ্য তাপমাত্রা বিস্তারকে সরাসরি একটি রঙ বা গ্রেস্কেল হিট ম্যাপে রূপান্তর করে। এটির বাহ্যিক আলোর প্রয়োজন হয় না, তাই এটি দিন বা রাতে কাজ করে। একটি মডিউল কোথায় গরম এবং কতটা তা স্পষ্টভাবে দেখা যায়। তাপ-চালিত ত্রুটি যেমন হটস্পট এবং ভাঙা গ্রিডলাইনের জন্য, ইনফ্রারেড প্রাকৃতিক সমাধান।
এই কারণেই ইনফ্রারেড পিভি প্ল্যান্টে ত্রুটি সনাক্তকরণের নির্ভুলতা এবং গতি উভয়ই বাড়ানোর একটি মূল উপায় হয়ে উঠেছে। একটি ইনফ্রারেড ক্যামেরা সহ একটি ড্রোন কয়েক মিনিটের মধ্যে পুরো অ্যারে স্ক্যান করতে পারে, যা ম্যানুয়াল ক্রুর চেয়ে কয়েক ডজন গুণ দ্রুত। কিন্তু তাপ দেখার এই ক্ষমতার মূল্য রয়েছে: চিত্রের গুণমান দৃশ্যমান আলোর তুলনায় অনেক কম।
পুরানো ম্যানুয়াল পদ্ধতিতে কর্মীরা যন্ত্রপাতি বহন করে এবং প্যানেল বাই প্যানেল পরিমাপ করে। এটি ধীর এবং অভিজ্ঞতার উপর অনেক বেশি নির্ভর করে। মডিউলগুলি ঘনবসতিপূর্ণ এবং হাজারে গণনা করা হলে, একবারে একটি করে পড়া ক্লান্তিকর, ত্রুটিপূর্ণ এবং রাতে প্রায় অসম্ভব। ড্রোন-প্লাস-ইনফ্রারেড কম্বো ক্যাপচার ধাপকে সর্বোচ্চ করে, কিন্তু যদি আপনি এখনও সেই হাজার হাজার ছবি হাতে পড়েন, তাহলে বাধা কেবল পরিমাপ থেকে দেখার দিকে সরে যায়। লুপ বন্ধ করতে আপনার ছবি পড়ার জন্য একটি অ্যালগরিদম প্রয়োজন। এটাই ডিপ লার্নিংয়ের সংকেত।

চিত্র 3: একটি সাধারণ ইনফ্রারেড তাপ মানচিত্র। এলাকাটি যত গরম, তার রঙ তত উষ্ণ, এবং অতিরিক্ত উত্তপ্ত অঞ্চলটি এক নজরে আলাদা হয়ে যায়। এটি হটস্পট সনাক্তকরণের কাঁচামাল।

চিত্র 4: দৃশ্যমান-আলো এবং ইনফ্রারেড ইমেজিংয়ের মধ্যে কাজের বিভাজন। তাপীয় ত্রুটির জন্য, ইনফ্রারেড প্রাকৃতিক প্রতিকার।
ইনফ্রারেড ত্রুটি সনাক্তকরণে তিনটি কঠিন হাড়
ইনফ্রারেড তাপ দেখতে পারে, কিন্তু এটি সনাক্তকরণ অ্যালগরিদমকে তিনটি কঠিন সমস্যা দেয়। এই তিনটিই কারণ যে অনেক রেডি-মেড অ্যালগরিদম পিভি ইনফ্রারেড কাজে ব্যর্থ হয়।
এক: কম কনট্রাস্ট। ইনফ্রারেড ফ্রেমগুলি সামগ্রিকভাবে নিস্তেজ এবং ধূসর। ত্রুটি এবং পটভূমির মধ্যে গ্রেস্কেল পার্থক্য শুরুতে ছোট, এবং তার উপরে ইমেজিং নয়েজ ত্রুটিগুলিকে পটভূমিতে গ্রাস করতে দেয়। অ্যালগরিদম মূল বৈশিষ্ট্যগুলি ধরতে পারে না, তাই নির্ভুলতা ক্ষতিগ্রস্ত হয়।
দুই: ব্যাপকভাবে পরিবর্তিত ত্রুটির স্কেল। একটি একক ইনফ্রারেড ফ্রেমের মধ্যে, হটস্পটের আকার দশগুণ পর্যন্ত ভিন্ন হতে পারে। কিছু একটি সম্পূর্ণ বাইপাস করা স্ট্রিং যা একটি বড় প্যাচ জুড়ে জ্বলছে; অন্যগুলি একটি কোণে সামান্য গরম হওয়া একটি মাত্র সেল। একটি নির্দিষ্ট রিসেপ্টিভ ফিল্ড, নেটওয়ার্ক এক পাসে স্পষ্টভাবে দেখতে পারে এমন পরিসর, এই ধরনের বিস্তারের বিপরীতে একটির জন্য অন্যটি হারাতে থাকে: বড় টার্গেট পান এবং ছোটটি মিস করেন, বা উল্টো।
তিন: ছোট-টার্গেট তথ্য হারিয়ে যায়। এটি সবচেয়ে জটিল। নিউরাল নেটওয়ার্ক স্তরে স্তরে ডাউনস্যাম্পল করে, উচ্চ-স্তরের অর্থ বের করতে ছবি সঙ্কুচিত করে। কিন্তু ছোট হটস্পটগুলি যা শুরুতে মাত্র কয়েক দশ পিক্সেল ছিল, সঙ্কুচিত হওয়ার সাথে সাথে মসৃণ হয়ে যায়, যতক্ষণ না সিদ্ধান্ত নেওয়ার সময় প্রায় কিছুই অবশিষ্ট থাকে না, এবং স্বীকৃতি ব্যাপকভাবে ক্ষতিগ্রস্ত হয়।
তিনটি একসাথে রাখলে এটি পরিষ্কার: পিভি ইনফ্রারেড ত্রুটি সনাক্তকরণ কঠিন কারণ আপনাকে একই সময়ে 'স্পষ্টভাবে দেখা যায় না, আকার সর্বত্র, সহজেই হারিয়ে যায়' এর সাথে লড়াই করতে হয়। SESPNet-এর তিনটি মূল আপগ্রেড প্রতিটি এই হাড়গুলির একটিকে লক্ষ্য করে: একটি পটভূমি দমন করতে শব্দার্থবিদ্যা বাড়ায়, একটি আকার পরিচালনা করতে পিরামিড তৈরি করে, একটি ছোট টার্গেট পুনরুদ্ধার করতে চ্যানেলগুলি রক্ষা করে।
কেন শুধু একটি রেডি-মেড ডিটেক্টর ব্যবহার করবেন না? অবজেক্ট ডিটেকশন দ্রুত এগিয়েছে, এবং এটি দুটি পথে বিভক্ত। একটি হল দ্বি-পর্যায়: প্রথমে মোটামুটি স্ক্রিনিং করে প্রার্থী অঞ্চল বের করা, তারপর প্রতিটি সাবধানে বিচার করা, উচ্চ নির্ভুলতা কিন্তু ধীর। অন্যটি হল এক-পর্যায়: একবার দেখলেই অবস্থান এবং শ্রেণি উভয়ই পাওয়া যায়, দ্রুত এবং রিয়েল টাইমের জন্য উপযুক্ত। YOLO সিরিজটি এক-পর্যায়ের ফ্ল্যাগশিপ। কিন্তু এই সাধারণ অ্যালগরিদমগুলি সাধারণ দৃশ্যমান ছবির উপর প্রশিক্ষিত, এবং কম কনট্রাস্ট, বিস্তৃত স্কেলের PV ইনফ্রারেড ফ্রেমে প্রয়োগ করলে তারা সংগ্রাম করে। SESPNet-এর আপগ্রেডগুলি সেই তিনটি ফাঁক পূরণ করে, ইনফ্রারেড ত্রুটির জন্য কাস্টম-মেড।

চিত্র 5: ইনফ্রারেড ত্রুটি সনাক্তকরণের তিনটি কঠিন হাড়: কম কনট্রাস্ট, একাধিক স্কেল এবং ছোট লক্ষ্য।

চিত্র 6: একটি মাল্টি-রোটার ড্রোন যা একটি ক্যামেরা বহন করছে, অ্যারেটির উপর দিয়ে উড়ে বাল্কে ইনফ্রারেড ছবি সংগ্রহ করছে, মিনিটের মধ্যে স্ক্যান করছে যা একটি ক্রু অর্ধেক দিনে কাভার করত।
প্রযুক্তিগত সুবিধা
প্রথম পদক্ষেপ: সিম্যান্টিক এনহ্যান্সমেন্ট, পটভূমি থেকে ত্রুটিগুলি ভাসিয়ে আনা
SESPNet তার বেস মডেল হিসেবে YOLOv10-এর উপর নির্মিত। YOLOv10 আজকের সবচেয়ে জনপ্রিয় রিয়েল-টাইম ডিটেক্টরগুলির মধ্যে একটি, যা 2024 সালের মে মাসে একটি সিংহুয়া টিম দ্বারা প্রকাশিত, দ্রুত, নির্ভুল এবং ডিপ্লয়মেন্ট-বান্ধব হওয়ার জন্য তৈরি। SESPNet এটিতে তিনটি অপারেশন করে, এবং প্রথমটি ব্যাকবোনে একটি সিম্যান্টিক ইনফরমেশন এনহ্যান্সমেন্ট মডিউল (SIEM) এম্বেড করে।
এটি যা সমাধান করে তা হল কম-কনট্রাস্ট সমস্যা। ইনফ্রারেড ত্রুটি ছবিতে দুর্বল কনট্রাস্ট ব্যাকগ্রাউন্ডের শব্দকে মডেলের বের করা বৈশিষ্ট্যগুলিতে হস্তক্ষেপ করতে দেয়, নির্ভুলতা ক্ষতিগ্রস্ত করে। SIEM একসাথে দুটি উপায়ে কাজ করে। একটি গ্লোবাল অ্যাটেনশন ব্রাঞ্চ পুরো ছবির সামগ্রিক অর্থ গ্রহণ করে, কাজ করে কী ব্যাকগ্রাউন্ড এবং কী একটি ত্রুটি লুকিয়ে রাখতে পারে, যাতে জঞ্জালের হস্তক্ষেপ কমে যায়। একটি লোকাল অ্যাটেনশন ব্রাঞ্চ ত্রুটির নিজস্ব বিবরণ এবং টেক্সচারের উপর ফোকাস করে, এর বৈশিষ্ট্য প্রকাশকে তীক্ষ্ণ করে।
প্রতিটি শাখা নিজস্ব জিনিস দেখে, তারপর গ্লোবাল এবং লোকাল ওয়েটেড হয়ে একত্রিত হয়। এটিকে চোখ কুঁচকে পুরো ছাদের রূপরেখা বের করা এবং জঞ্জাল বাদ দেওয়ার মতো ভাবুন, তারপর ঝুঁকে পড়ে সন্দেহজনক প্যাচটির দিকে তাকানো। কাছের এবং দূরের মিলিত, এবং ত্রুটিটি নিস্তেজ পটভূমি থেকে উঠে আসে। একত্রিত বৈশিষ্ট্যগুলি ত্রুটির বিবরণ রাখে যখন ব্যাকগ্রাউন্ডের হস্তক্ষেপ দমন করে, তাই বৈশিষ্ট্য প্রকাশ স্পষ্টভাবে শক্তিশালী।
ফলাফলটি পরে অ্যাবলেশন স্টাডিতে স্পষ্টভাবে দেখায়: শুধুমাত্র SIEM যোগ করলে তিনটি টার্গেট ক্লাস জুড়ে গড় নির্ভুলতা বৃদ্ধি পায়, জটিল ব্যাকগ্রাউন্ড প্রতিরোধে প্রকৃত লাভ সহ।
ব্যাকবোন হল মডেলের সেই অংশ যা প্রথমে ছবি স্পর্শ করে এবং মৌলিক বৈশিষ্ট্যগুলো বের করে। এখানে SIEM রাখার অর্থ হল উৎসে পরিষ্কার করা: কিছু পাস করার আগেই, ত্রুটির বৈশিষ্ট্যগুলো শক্তিশালী করা হয় এবং পটভূমির শব্দ দমন করা হয়। পরিষ্কার উৎসের সাথে, পরবর্তী স্কেল হ্যান্ডলিং এবং টার্গেট লোকালাইজেশন বিশৃঙ্খলার কারণে বিপথগামী হবে না। তাই এটি ব্যাকবোনে থাকে এবং অন্য কোথাও নয়। দূষণকে আগেই মোকাবেলা করুন।

চিত্র 7: SIEM শব্দার্থ-বর্ধন মডিউলের দ্বৈত-শাখা কাঠামো। গ্লোবাল শাখা বড় ছবি পড়ে পটভূমি দমন করে, লোকাল শাখা বিস্তারিত দেখে ত্রুটি শক্তিশালী করে, তারপর দুটি ওজনযুক্ত এবং একীভূত হয়।

চিত্র 8: একটি ছাদের উপর PV অ্যারে। মডিউলগুলির ঘন ক্ষেত্রটি ঠিক সেই বিশৃঙ্খল দৃশ্য যা একটি সনাক্তকরণ অ্যালগরিদমে হস্তক্ষেপ সরবরাহ করে।
দ্বিতীয় পদক্ষেপ: পিরামিড পুলিং, বড় এবং ছোট উভয় হটস্পট ফোকাসে
দ্বিতীয় পরিবর্তনটি YOLOv10-এর মূল স্পেশিয়াল পিরামিড পুলিং মডিউলকে একটি স্পেস অ্যাটেনশন পিরামিড পুলিং মডিউল, SAPPM-এ পরিবর্তন করে। এটি বিভিন্ন-স্কেল সমস্যা লক্ষ্য করে।
"পিরামিড পুলিং" বলতে একই ফিচার ম্যাপকে একসাথে বিভিন্ন আকারের একাধিক উইন্ডো দিয়ে স্ক্যান করা বোঝায়। ছোট উইন্ডো সূক্ষ্ম বিবরণ দেখে, ছোট হটস্পটের জন্য ভাল; বড় উইন্ডো বিস্তৃত দেখে, বড় হটস্পটের জন্য ভাল। গবেষণাটি ছোট থেকে বড় পর্যন্ত সমান্তরালে বেশ কয়েকটি পুলিং উইন্ডো চালায়, তাই ত্রুটিটি কয়েকটি সারি জুড়ে থাকুক বা একটি তালুর আকারের দাগ হোক, সঠিক উইন্ডো এটি ধরে।
এর উপরে, SAPPM স্পেশিয়াল অ্যাটেনশনের একটি স্তর যোগ করে। এটি বিভিন্ন উইন্ডো থেকে বৈশিষ্ট্যগুলিকে বিভিন্ন ওজন বরাদ্দ করে, যাতে সত্যিকারের মূল স্কেল তথ্য সামনে এবং কেন্দ্রে রাখা হয় এবং অপ্রাসঙ্গিক কমিয়ে দেওয়া হয়, তারপর এই মাল্টি-স্কেল বৈশিষ্ট্যগুলিকে একটি পূর্ণাঙ্গ ফিচার ম্যাপে সেলাই করে। সংক্ষেপে, প্রথম অংশটি "প্রতিটি আকার দেখা" পরিচালনা করে, দ্বিতীয় অংশটি "যা দেখা উচিত তা হাইলাইট করা" পরিচালনা করে। একসাথে তারা মডেলের মাল্টি-স্কেল টার্গেটের অনুভূতি তীব্রভাবে বাড়িয়ে তোলে।
এটি সরাসরি পুরানো এক-হারানো-অন্যটির-জন্য সমস্যা হ্রাস করে। একটি নির্দিষ্ট-গ্রহণযোগ্য-ক্ষেত্র নেটওয়ার্ক বড়টির যত্ন নেওয়ার সময় ছোট টার্গেট ফেলে দেয়; SAPPM থাকার সাথে, বড় এবং ছোট উভয় হটস্পট একই পাসে স্পষ্টভাবে দেখা যায়, স্কেলের ব্যবধান যতই প্রশস্ত হোক না কেন।

চিত্র 9: SAPPM মাল্টি-স্কেল ফিচার পিরামিড পুলিংয়ের একটি স্কেচ, বিভিন্ন আকারের উইন্ডো দিয়ে সমান্তরালে স্ক্যান করে তারপর স্পেশিয়াল অ্যাটেনশন ওয়েটিং দিয়ে সেলাই করা।

চিত্র 10: একটি প্ল্যান্টের বায়বীয় শট। ড্রোন বিভিন্ন উচ্চতায় ক্যাপচার করে, একই ত্রুটিকে ছবিতে আরও বৈচিত্র্যময় স্কেলে উপস্থিত করে।
তৃতীয় পদক্ষেপ: চ্যানেল অ্যাটেনশন, প্রায় হারিয়ে যাওয়া ছোট টার্গেটগুলো ফিরিয়ে আনা
তৃতীয় পরিবর্তনটি নেক নেটওয়ার্কে আসে, যা একটি মাল্টি-স্কেল চ্যানেল অ্যাটেনশন মেকানিজম, MCI তৈরি করে। এটি সবচেয়ে জটিল সমস্যা, ছোট-টার্গেট তথ্য হারানো, নিরাময় করে।
প্রথমে, চ্যানেল সম্পর্কে একটু বলি। যখন একটি নেটওয়ার্ক একটি চিত্র প্রক্রিয়া করে, তখন এটি বৈশিষ্ট্যগুলিকে অনেকগুলি সমান্তরাল চ্যানেলে বিভক্ত করে, প্রতিটি চিত্রটিকে একটি ভিন্ন কোণ থেকে বর্ণনা করে। ছোট-টার্গেট বৈশিষ্ট্যগুলি ইতিমধ্যেই দুর্বল, এই চ্যানেলগুলিতে ছড়িয়ে ছিটিয়ে থাকে, এবং যদি প্রতিটি চ্যানেল কেবল নিজের দিকেই মনোযোগ দেয় এবং কোনো বিনিময় না করে, তবে তথ্যের সেই মূল্যবান বিটটি স্তর-দ্বারা-স্তর হস্তান্তরে সহজেই ডুবে যায়।
MCI-এর পদ্ধতি হল চ্যানেলগুলির মধ্যে মিথস্ক্রিয়া তৈরি করা, তাদের একে অপরের সাথে কথা বলতে দেওয়া। যেখানেই একটি চ্যানেলে এখনও ছোট টার্গেটের চিহ্ন থাকে, ক্রস-চ্যানেল সহযোগিতা এটিকে প্রশস্ত করে এবং সংরক্ষণ করে। এটি ছোট-স্কেল বৈশিষ্ট্য তথ্য নিষ্কাশনকে আরও শক্তিশালী করে, এবং সেই ছোট হটস্পটগুলি যা ডাউনস্যাম্পলিংয়ে অদৃশ্য হতে চলেছিল, সেগুলি ফিরিয়ে আনা হয়।
এই তিনটি পদক্ষেপ নেটওয়ার্কে কোথায় অবস্থিত তাও ইচ্ছাকৃত। SIEM ব্যাকবোন উৎসে বৈশিষ্ট্যগুলি পরিষ্কার করে, SAPPM ব্যাকবোনের শেষে মাল্টি-স্কেল তথ্য সংক্ষিপ্ত করে, এবং MCI নেক-এ চূড়ান্ত পলিশ করে যা ব্যাকবোনকে ডিটেকশন হেডের সাথে সংযুক্ত করে। সামনে, মাঝখানে, পিছনে, একসাথে তারা বৈশিষ্ট্য নিষ্কাশন, সংক্ষিপ্তকরণ এবং আউটপুটের সম্পূর্ণ চেইন কভার করে, এবং প্রতিটি ধাপে ইনফ্রারেড-ডিফেক্টের একটি ব্যথার পয়েন্টের জন্য লক্ষ্যযুক্ত প্রতিকার পাওয়া যায়।
তিনটি পদক্ষেপের স্পষ্ট ভূমিকা রয়েছে: SIEM কনট্রাস্ট পরিচালনা করে, SAPPM স্কেল পরিচালনা করে, MCI ছোট টার্গেট পরিচালনা করে। তারা একা লড়াই করে না বরং ব্যাটন পাস করে: প্রথমে ত্রুটিটিকে ব্যাকগ্রাউন্ড থেকে তুলে আনা, তারপর সমস্ত আকার কভার করা, তারপর সবচেয়ে বেশি পিছলে যাওয়ার সম্ভাবনা থাকা ছোট টার্গেটটি ধরা। এই সংমিশ্রণের সাথে, ইনফ্রারেড ত্রুটি সনাক্তকরণের তিনটি সবচেয়ে কঠিন হাড় একে একে ভেঙে যায়।

চিত্র 11: ইনফ্রারেড হটস্পটগুলি স্কেল অনুসারে বড়, মাঝারি এবং মিনি-তে সাজানো। আকারের ব্যবধান বিশাল, এবং সবচেয়ে ছোট হটস্পটগুলি মিস করা সবচেয়ে সহজ।

চিত্র 12: ইনফ্রারেড ক্যামেরা দ্বারা ধরা একটি অস্পষ্ট টার্গেট। টার্গেট যত ছোট এবং ম্লান, প্রক্রিয়াকরণে মসৃণ হয়ে যাওয়ার সম্ভাবনা তত বেশি।
পণ্য প্রয়োগ
স্কোরকার্ড: 92.1% নির্ভুলতা, প্রতি সেকেন্ডে 62 ফ্রেম
তিনটি পদক্ষেপের প্রভাব ডেটাতে নেমে আসে। গবেষকরা তাদের নিজস্ব PV মডিউল ইনফ্রারেড ত্রুটি ডেটাসেট তৈরি করেছেন, চিত্রে তারা যে পিক্সেল আকার নেয় তার দ্বারা হটস্পটগুলিকে তিনটি শ্রেণিতে লেবেল করেছেন: 64x64 পিক্সেলের বেশি বড়, 32x32 এবং 64x64-এর মধ্যে মাঝারি, 32x32-এর নিচে মিনি। সনাক্তকরণ ভাল কিনা তা শ্রেণি অনুযায়ী, স্কেল অনুযায়ী পড়তে হবে।
নির্ভুলতা দুটি মেট্রিকের উপর নির্ভর করে। একটি হল রিকল, R, যা উত্তর দেয় "যে ত্রুটিগুলি খুঁজে পাওয়া উচিত, তার মধ্যে কতগুলি পুনরুদ্ধার করা হয়েছে।" অন্যটি হল গড় গড় নির্ভুলতা, PmA, যা শ্রেণী জুড়ে সনাক্তকরণ নির্ভুলতার একটি সমন্বিত পরিমাপ, যা একটি ডিটেক্টরের জন্য সবচেয়ে গুরুত্বপূর্ণ মোট স্কোর। এর সাথে সনাক্তকরণের গতি যোগ করুন, যা প্রতি সেকেন্ডে প্রক্রিয়াকৃত ফ্রেমে পরিমাপ করা হয়, এবং এই তিনটি সংখ্যা একসাথে একটি অ্যালগরিদমের সম্পূর্ণ গল্প বলে।
মডিউল-বাই-মডিউল অ্যাবলেশন দিয়ে শুরু করুন। বেসলাইন হিসেবে স্টক YOLOv10-এর গড় গড় নির্ভুলতা 89.8%। শুধুমাত্র SIEM যোগ করলে, তা 90.4% পর্যন্ত যায়; শুধুমাত্র SAPPM যোগ করলে, 90.5%; শুধুমাত্র MCI যোগ করলে, 90.7%। প্রতিটি পদক্ষেপ সাহায্য করে। তিনটি একসাথে স্ট্যাক করলে, সম্পূর্ণ SESPNet, এবং গড় গড় নির্ভুলতা 92.1% এ লাফিয়ে যায়। সবচেয়ে উল্লেখযোগ্য হল ছোট লক্ষ্য: বেসলাইনের মিনি নির্ভুলতা মাত্র 86.7%, এবং তিনটি সহ এটি 90.3% এ উঠে যায়, পুরো 3.6 পয়েন্ট, যা MCI-এর ছোট লক্ষ্য পুনরুদ্ধারে কাজ প্রমাণ করে।

চিত্র 13: মডিউল-বাই-মডিউল অ্যাবলেশন। তিনটি মডিউল স্ট্যাক করার সাথে, সবচেয়ে কঠিন ছোট-লক্ষ্য নির্ভুলতা 86.7% থেকে 90.3% এ বৃদ্ধি পায়।

চিত্র 14: একটি অন্তহীন বড় মাটিতে স্থাপিত প্ল্যান্ট। এর হাজার হাজার মডিউল ঠিক এই অ্যালগরিদমকে একে একে পরীক্ষা করতে হবে।
মুখোমুখি: এক মঞ্চে নয়টি অ্যালগরিদম
নিজের সাথে তুলনা করা যথেষ্ট নয়। গবেষণাটি SESPNet-কে আটটি অন্যান্য মূলধারার অ্যালগরিদমের সাথে একই মঞ্চে রাখে, একই ডেটাসেটে প্রশিক্ষণ দেয় এবং পাশাপাশি নির্ভুলতা ও গতি পরিমাপ করে।
ফলাফল নিজেই কথা বলে। ক্লাসিক দ্বি-পর্যায়ের অ্যালগরিদম যেমন Faster R-CNN এবং Cascade R-CNN-এর সীমিত বৈশিষ্ট্য নিষ্কাশন রয়েছে এবং ধীর গতিতে চলে, 86% থেকে 88% গড় গড় নির্ভুলতায় পৌঁছায়, যা উচ্চ রিয়েল-টাইম কর্মক্ষমতা দাবি করে এমন দৃশ্যের জন্য উপযুক্ত নয়। SSD সবচেয়ে দ্রুত কিন্তু এর নির্ভুলতা মাত্র 74.3%, স্পষ্টতই কম। YOLO সিরিজ সামগ্রিকভাবে আরও সুষম: YOLOv7-এর 88.1% থেকে, YOLOX, YOLOv8, YOLOv10 এবং YOLOv11-এর মাধ্যমে, নির্ভুলতা 89% থেকে 90% রেঞ্জে ওঠে এবং গতি সবগুলোতেই প্রতি সেকেন্ডে প্রায় পঞ্চাশ থেকে ষাট ফ্রেম।
SESPNet সেই বক্ররেখাকে আরও উপরের ডানদিকে ঠেলে দেয়: 92.1% গড় গড় নির্ভুলতা, দ্বিতীয় স্থানের থেকে প্রায় 2 পয়েন্ট বেশি, এবং 62.4 ফ্রেম প্রতি সেকেন্ড, YOLO স্পিডস্টারদের সাথে তাল মিলিয়ে। এটি নির্ভুলতা বাড়াতে গতি বিসর্জন দেয় না; এটি দ্রুত-এবং-নির্ভুলের উপরের-ডান স্থান ধরে রাখে যা অন্যরা পৌঁছাতে পারে না। এটাই এর সবচেয়ে বড় মূল্য। বিশাল মডিউল সংখ্যার দৃশ্যে যেখানে আপনি পেট্রোলিং করার সময় বিচার করেন, প্রতিটি সামান্য ধীরগতি খরচ।
R = TP ÷ ( TP + FN ) · P = TP ÷ ( TP + FP )
এই দুটি লাইন নির্ভুলতা মেট্রিক্সের ভিত্তি সংজ্ঞা। R (রিকল) প্রকৃত ত্রুটির পুনরুদ্ধারের অংশ পরিমাপ করে, P (প্রিসিশন) পরিমাপ করে কতগুলি রিপোর্ট করা ত্রুটি প্রকৃত, এবং PmA হল ক্লাস এবং প্রিসিশন স্তর জুড়ে গণনা করা মোট স্কোর। যুক্তিটি জটিল নয়: যতটা সম্ভব কম মিস করুন (উচ্চ রিকল) এবং যতটা সম্ভব কম মিথ্যা অ্যালার্ম দিন (উচ্চ প্রিসিশন), উভয় প্রান্ত নিয়ন্ত্রণে রাখুন, এবং আপনার একটি নির্ভরযোগ্য ডিটেক্টর থাকবে।

চিত্র 15: নয়টি অ্যালগরিদমের নির্ভুলতা-গতির তুলনা। SESPNet 92.1% নির্ভুলতা এবং 62.4 FPS সহ উপরের-ডান কোণায় অবস্থান করছে।

চিত্র 16: একটি এম্বেডেড প্ল্যাটফর্মে বাস্তব-বিশ্ব পরীক্ষা। সবচেয়ে নির্ভুল SESPNet এখনও 12.6 FPS এ স্থির রয়েছে।
একটি পাম-আকারের বাক্সে সংকুচিত এবং এখনও রিয়েল টাইম
ল্যাবে ভালো চলার মানে এই নয় যে এটি মাঠে ব্যবহারযোগ্য। পিভি প্ল্যান্টগুলি বেশিরভাগই বাইরে, যেখানে পরিদর্শন সরঞ্জামের কম্পিউট এবং শক্তি সীমিত। অ্যালগরিদমটি একটি কম-শক্তির ছোট বাক্সে ফিট হয়ে রিয়েল টাইমে চলতে পারে কিনা তা প্রকৃত স্থাপনার শেষ বাধা।
গবেষকরা এটি যাচাই করার জন্য জেটসন ন্যানো নামক একটি এম্বেডেড প্ল্যাটফর্মে পোর্ট করেছেন। এর প্রসেসরটি একটি কোয়াড-কোর ARM চিপ যা একটি এন্ট্রি-লেভেল 128-কোর GPU এর সাথে যুক্ত, যা ল্যাব ওয়ার্কস্টেশনের ডেডিকেটেড কার্ডের তুলনায় কম্পিউট এবং শক্তি উভয় ক্ষেত্রেই অনেক নিচে। SESPNet একই ইনপুট স্কেলে স্থাপন করা হয়েছিল, তারপর এই ছোট বোর্ডে অন্যান্য অ্যালগরিদমের বিরুদ্ধে প্রতিযোগিতা করা হয়েছিল।
ফলাফল আবার তার ভারসাম্য প্রমাণ করে। ক্লাসিক টু-স্টেজ অ্যালগরিদমগুলি এম্বেডেড সেটিংয়ে তাদের আসল রূপ দেখায়: ফাস্টার R-CNN প্রতি সেকেন্ডে 1.9 ফ্রেমে নেমে যায়, সবে রিয়েল টাইম; ক্যাসকেড R-CNN মাত্র 3.7। YOLO সিরিজ সাধারণত প্রায় এগারো বা বারো ফ্রেমে পড়ে, যখন SESPNet 12.6 ফ্রেম প্রতি সেকেন্ড ধরে রাখে এবং শীর্ষ 92.1% নির্ভুলতা বজায় রাখে, হালকা YOLO গুলির পাশাপাশি, এমনকি কিছুটা এগিয়ে। কম্পিউট ব্যাপকভাবে কমানো সত্ত্বেও, এটি নির্ভুল এবং স্থির থাকে, দেখায় যে ডিজাইনটি সম্পদ-সীমাবদ্ধ দৃশ্যের জন্য কতটা উপযুক্ত।
এর মানে হল এই অ্যালগরিদম দিয়ে সজ্জিত একটি ড্রোন বা পোর্টেবল পরিদর্শককে ছবি ক্লাউডে পাঠিয়ে ধীরে ধীরে প্রক্রিয়া করতে হবে না। ঘটনাস্থলে, রিয়েল টাইমে, এটি বলতে পারে কোন প্যানেলে হটস্পট আছে। পরিদর্শন দক্ষতা এবং প্রতিক্রিয়ার গতি উভয়ই আরও এক ধাপ উপরে যায়।
উড়ন্ত অবস্থায় বিচার করার মান শুধু একটি রাউন্ড ট্রিপ বাঁচানোর চেয়ে বেশি। প্রান্তে কম্পিউট স্থাপনের অর্থ হল দুর্বল সিগন্যালযুক্ত দূরবর্তী প্ল্যান্টেও পরিদর্শন চালানো যেতে পারে; একটি সন্দেহজনক হটস্পট চিহ্নিত করলে আপনি সেখানেই তা চিহ্নিত করতে পারেন এবং সাথে সাথে নিশ্চিত করতে পুনরায় উড়তে পারেন, দ্বিতীয় সর্টির আগে ডেটা ফিরে আসা এবং ম্যানুয়াল পর্যালোচনার জন্য অপেক্ষা না করে। শত শত মেগাওয়াটে পরিমাপ করা এবং লক্ষ লক্ষ মডিউলযুক্ত বড় প্ল্যান্টের জন্য, এই অন-সাইট রিয়েল-টাইম ক্ষমতা সরাসরি নির্ধারণ করে যে একটি সম্পূর্ণ পরিদর্শন ঘন্টা না দিন লাগবে।
সমাপ্তি: প্রতিটি অতিরিক্ত গরম প্যানেলের জন্য লুকানোর জায়গা নেই
পিছনে তাকালে, SESPNet-এর চতুরতা কিছু জটিল কাঠামো স্ট্যাক করার মধ্যে নয়, বরং সঠিক লক্ষণগুলির চিকিৎসা করার মধ্যে। ইনফ্রারেড কনট্রাস্ট কম, তাই সিম্যান্টিক এনহ্যান্সমেন্ট ব্যাকগ্রাউন্ডকে দমন করে। ডিফেক্ট স্কেল বিশৃঙ্খল, তাই পিরামিড পুলিং সব আকার কভার করে। ছোট টার্গেট সহজেই হারিয়ে যায়, তাই চ্যানেল অ্যাটেনশন তাদের ফিরিয়ে আনে। তিনটি পদক্ষেপ, প্রতিটি তার কাজে, এবং ব্যাটন পাস করে।
যা আরও বিরল তা হল এটি নির্ভুলতার জন্য মডেলকে মোটা করেনি। অনেক অ্যালগরিদম অন্ধভাবে উচ্চ নির্ভুলতা তাড়া করে, শেষ পর্যন্ত ফুলে যায়, গতি কমিয়ে দেয় এবং এমনকি একটি এমবেডেড ডিভাইসে ফিটও করতে পারে না। SESPNet নির্ভুলতায় শীর্ষে থাকার সময় তার গতি ধরে রাখে এবং এটি নাটকীয়ভাবে কাটানো কম্পিউটের পরীক্ষায় টিকে গেছে। নির্ভুল, দ্রুত এবং হালকা হওয়ার এই ভারসাম্যই হল সেই গুণ যা ক্ষেত্র সবচেয়ে বেশি মূল্য দেয়। একটি প্রযুক্তি ভাল কিনা তা নির্ভর করে এটি একটি বাস্তব প্ল্যান্টে বাস্তব কাজ করতে পারে কিনা।
92.1% গড় নির্ভুলতা, 62.4 ফ্রেম প্রতি সেকেন্ড, এবং পাম-আকারের বাক্সে রিয়েল টাইমে চালানোর মতো ছোট। এই তিনটি সংখ্যা একসাথে একটি টুলের রূপরেখা দেয় যা সত্যিই প্ল্যান্টে নেমে কাজ করতে পারে। এটি একটি নিস্তেজ ধূসর ইনফ্রারেড ইমেজকে, যা একসময় মানুষের চোখের জন্যও কঠিন ছিল, একটি স্বাস্থ্য রিপোর্টে রূপান্তরিত করে যেখানে ত্রুটিগুলির লুকানোর জায়গা নেই।
যখন এই ধরনের অ্যালগরিদম বহনকারী একটি ড্রোন নীল অ্যারের পর ক্ষেত জুড়ে উড়ে যায়, প্রতিটি শান্তভাবে অতিরিক্ত গরম প্যানেল প্রথম মুহূর্তে চিহ্নিত এবং মোকাবেলা করা হয়। লুকানো হটস্পটগুলি দৃশ্যমান হয়ে ওঠে এবং আপাতদৃষ্টিতে ছোট ঝুঁকিগুলি নিভিয়ে দেওয়া হয়। যা টিকে থাকে তা হল একটি প্ল্যান্ট যা সূর্যালোককে শক্তিতে রূপান্তরিত করে, দীর্ঘ, নিরাপদ এবং পূর্ণ লোডে।
Ooitech-এর দৃষ্টিভঙ্গি
এখানে আমাদের সবচেয়ে বেশি যা আঘাত করে তা হল সনাক্তকরণ এবং উত্পাদন একই নির্ভরযোগ্যতা মুদ্রার দুটি দিক। মাঠে চিহ্নিত একটি হটস্পট প্রায়শই লাইনে জন্ম নেওয়া একটি মাইক্রো-ক্র্যাক বা ঠান্ডা সোল্ডার জয়েন্টে ফিরে যায়, এই কারণেই একটি মডিউল উত্পাদন লাইনে স্ট্রিংগার ওয়েল্ডিং, লেআউপ অ্যালাইনমেন্ট এবং ল্যামিনেশন নিয়ন্ত্রণ এত গুরুত্বপূর্ণ। সেই পদক্ষেপগুলি সঠিকভাবে করুন এবং আপনি প্রথম স্থানে মাঠে কম হটস্পট ফিড করবেন। আপনি যদি একটি বাস্তব মডিউল লাইন কীভাবে তৈরি এবং টিউন করা হয় তা দেখতে চান, Ooitech YouTube চ্যানেলে আমাদের কারখানা ওয়াকথ্রুগুলি (www.youtube.com/ooitech) দেখার এবং সাবস্ক্রাইব করার মতো।