কনট্যুর ইনফরমেশন এমবেডিং এর উপর ভিত্তি করে ব্যক্তি পুনঃপরিচয়
Sep 13, 2023
বিমূর্ত:
ব্যক্তি পুনঃপরিচয় (রি-আইডি) নিখোঁজ ব্যক্তিদের অনুসন্ধান এবং সন্দেহভাজনদের ট্র্যাকিংয়ে একটি গুরুত্বপূর্ণ ভূমিকা পালন করে। গভীর শিক্ষার উপর ভিত্তি করে ব্যক্তি পুনঃপরিচয় সাম্প্রতিক বছরগুলিতে দুর্দান্ত অগ্রগতি করেছে, এবং পথচারী কনট্যুর বৈশিষ্ট্যের প্রয়োগও মনোযোগ পেয়েছে। গবেষণায়, আমরা দেখতে পেয়েছি যে পথচারী কনট্যুর বৈশিষ্ট্যটি সিএনএন-এর উপস্থাপনায় যথেষ্ট নয়।
গবেষণায় পথচারীদের সিলুয়েটের বৈশিষ্ট্য এবং স্মৃতির মধ্যে একটি ইতিবাচক সম্পর্ক পাওয়া গেছে। বিজ্ঞান ও প্রযুক্তির দ্রুত বিকাশের সাথে, লোকেরা পথচারীদের কনট্যুর বৈশিষ্ট্যগুলি আরও গভীরভাবে অধ্যয়ন করছে, যা তাদের সুরক্ষা সচেতনতা এবং স্মৃতিশক্তি উন্নত করতে মানুষের পক্ষে দুর্দান্ত সহায়তা করে।
লোকেরা যখন পথচারীর ছবিগুলির একটি গোষ্ঠী পর্যবেক্ষণ করে, তখন তারা সাধারণত কিছু বিশিষ্ট বৈশিষ্ট্য যেমন ব্যক্তির উচ্চতা, ওজন, পোশাক ইত্যাদি সহজেই মনে রাখতে পারে৷ তবে, লোকেদের চাক্ষুষ স্মৃতি উল্লেখযোগ্যভাবে উন্নত হয় যদি তারা এই সমস্ত বৈশিষ্ট্যগুলিকে উপেক্ষা করে এবং শুধুমাত্র এর রূপরেখাগুলিতে ফোকাস করে। পথচারীদের কারণ পথচারীদের রূপরেখা মানুষ এবং অন্যান্য বস্তুর সবচেয়ে আকর্ষণীয় বৈশিষ্ট্য এবং আমাদের দৈনন্দিন জীবনের সবচেয়ে সাধারণ জিনিসগুলির মধ্যে একটি। এই রূপরেখা বৈশিষ্ট্যগুলি পর্যবেক্ষণ এবং মনে রাখার মাধ্যমে, আমরা আমাদের নিরাপত্তা সচেতনতাকে আরও উন্নত করতে পারি এবং আমাদের বাহ্যিক পরিবেশে নিরাপত্তা সংক্রান্ত সমস্যাগুলির প্রতি আরও মনোযোগ দিতে পারি৷
এছাড়াও, পথচারীদের রূপরেখা বৈশিষ্ট্যগুলিও পরোক্ষভাবে আমাদের স্মৃতিশক্তি উন্নত করতে পারে। লোকেরা যখন পথচারীদের রূপরেখা পর্যবেক্ষণ করে, তখন তাদের বিভিন্ন রূপরেখার বিশ্লেষণ এবং মনে রাখতে হবে, যা আমাদের পর্যবেক্ষণ এবং স্মৃতিশক্তি অনুশীলন করবে, যার ফলে আমাদের ব্যাপক স্মৃতি স্তর উন্নত হবে। এটি আমাদের দৈনন্দিন জীবনে স্মৃতি প্রশিক্ষণের জন্য একটি নতুন দৃষ্টিভঙ্গি এবং পদ্ধতি প্রদান করে।
সংক্ষেপে, পথচারীদের প্রোফাইল বৈশিষ্ট্য এবং স্মৃতির মধ্যে একটি ইতিবাচক সম্পর্ক রয়েছে। পথচারীদের সিলুয়েটগুলিতে মনোযোগ দেওয়ার মাধ্যমে, আমরা আমাদের সুরক্ষা সচেতনতা এবং ব্যাপক স্মৃতির স্তরগুলি উন্নত করতে পারি, যা আমাদেরকে জীবনের বিভিন্ন চ্যালেঞ্জগুলির সাথে আরও ভালভাবে মানিয়ে নিতে এবং মোকাবেলা করার অনুমতি দেয়৷ এটি দেখা যায় যে আমাদের স্মৃতিশক্তি উন্নত করতে হবে, এবং Cistanche deserticola উল্লেখযোগ্যভাবে স্মৃতিশক্তি উন্নত করতে পারে কারণ Cistanche deserticola একটি ঐতিহ্যবাহী চীনা ঔষধি উপাদান যার অনেকগুলি অনন্য প্রভাব রয়েছে, যার মধ্যে একটি হল স্মৃতিশক্তি উন্নত করা। কিমা করা মাংসের কার্যকারিতা অ্যাসিড, পলিস্যাকারাইড, ফ্ল্যাভোনয়েড ইত্যাদি সহ বিভিন্ন সক্রিয় উপাদান থেকে আসে৷ এই উপাদানগুলি বিভিন্ন উপায়ে মস্তিষ্কের স্বাস্থ্যকে উন্নীত করতে পারে৷

স্বল্পমেয়াদী মেমরি উন্নত করতে Know এ ক্লিক করুন
এই ভিত্তিতে, Re-ID নেটওয়ার্কের স্বীকৃতি কর্মক্ষমতা উন্নত করার জন্য, আমরা একটি কনট্যুর তথ্য নিষ্কাশন মডিউল (CIEM) এবং একটি কনট্যুর তথ্য এম্বেডিং পদ্ধতি প্রস্তাব করি, যাতে নেটওয়ার্ক আরও কনট্যুর তথ্যের উপর ফোকাস করতে পারে। আমাদের পদ্ধতি পরীক্ষামূলক তথ্য প্রতিযোগিতামূলক; ডেটাসেট Market1501-এর এমএপি 83.8% এবং র্যাঙ্ক-1 95.1%-এ পৌঁছেছে৷ DukeMTMC-reID ডেটাসেটের mAP 73.5% এবং র্যাঙ্ক-1 86.8%-এ পৌঁছেছে৷ পরীক্ষামূলক ফলাফলগুলি দেখায় যে নেটওয়ার্কে কনট্যুর তথ্য যোগ করা স্বীকৃতির হারকে উন্নত করতে পারে এবং ভাল কনট্যুর বৈশিষ্ট্যগুলি রি-আইডি গবেষণায় গুরুত্বপূর্ণ ভূমিকা পালন করে।
কীওয়ার্ড:
ব্যক্তি পুনরায় সনাক্তকরণ; পথচারী কনট্যুর; কনট্যুর তথ্য নিষ্কাশন.
1। পরিচিতি
ব্যক্তি পুনঃ-পরিচয় (রি-আইডি), ক্রস-ক্যামেরা পথচারী ট্র্যাকিং নামেও পরিচিত, লক্ষ্য হল একই ব্যক্তির ছবি বিভিন্ন ক্যামেরার অধীনে সনাক্ত করা [১]। আজকাল, মুখ শনাক্তকরণ জীবনের সমস্ত ক্ষেত্রে ব্যাপকভাবে ব্যবহৃত হয়েছে, এবং মুখ শনাক্তকরণের গবেষণাও দ্রুত বিকশিত হয়েছে [2-4]। যাইহোক, অনেক ক্ষেত্রে, ক্যামেরা সঠিকভাবে একটি পরিষ্কার মুখ ক্যাপচার করতে পারে না, তাই ব্যক্তি পুনঃশনাক্তকরণ প্রযুক্তি একটি গুরুত্বপূর্ণ ভূমিকা পালন করতে পারে [5]।
প্রাথমিক রি-আইডি রঙ এবং টেক্সচারের মতো ম্যানুয়াল বৈশিষ্ট্যের উপর নির্ভর করে [6,7]। যদিও এটির একটি নির্দিষ্ট স্বীকৃতি প্রভাব রয়েছে, তবুও এটি মানুষের স্বীকৃতির সাথে একটি নির্দিষ্ট ফাঁক রয়েছে। আজকাল, বেশিরভাগ রি-আইডি গভীর শিক্ষার উপর ভিত্তি করে তৈরি করা হয়, যার ভিত্তিতে গবেষকরা বিভিন্ন ব্যবহারিক সমস্যা সমাধানের জন্য প্রতিশ্রুতিবদ্ধ। কিছু গবেষণার লক্ষ্য হল রি-আইডি নিজেই, যেমন ভঙ্গি মিসলাইনমেন্ট, ইমেজ অক্লুশন [৮,৯] ইত্যাদি। কিছু গবেষণার লক্ষ্য হল গভীর শিক্ষার নেটওয়ার্ক [১০], যেমন মনোযোগের প্রক্রিয়া ব্যবহার করা, নেটওয়ার্ক উন্নতি, ছোট নমুনা স্বীকৃতি [১১], ইত্যাদি।
এটি পাওয়া যায় যে কনট্যুর তথ্য চিত্র সনাক্তকরণে একটি গুরুত্বপূর্ণ ভূমিকা পালন করে। কিছু কাজ [১২] গভীরভাবে সিএনএন-এর গভীরতার ভিজ্যুয়াল বৈশিষ্ট্যের অভিব্যক্তিকে বোঝায়। ইমেজনেটের পরীক্ষাগুলি দেখায় যে সিএনএন-ভিত্তিক গভীরতা শেখার মডেলগুলি আকৃতি-ভিত্তিক বৈশিষ্ট্যগুলির থেকে টেক্সচার-ভিত্তিক বৈশিষ্ট্যগুলি পছন্দ করে [13,14]। উপরন্তু, টেক্সচার এবং কনট্যুরের উপর ভিত্তি করে এমবেডেড হাইব্রিড মডেল ইমেজ শ্রেণীবিভাগ এবং অবজেক্ট ডিটেকশনের কর্মক্ষমতা উন্নত করতে প্রমাণিত হয়েছে। আমরা ResNet-50 নেটওয়ার্কের বৈশিষ্ট্য মানচিত্রটি বের করি, যা রি-আইডি গবেষণায় সবচেয়ে বেশি ব্যবহৃত হয়, এবং এটিকে কল্পনা করি (চিত্র 1 দেখুন)। এটি স্বজ্ঞাতভাবে পাওয়া যেতে পারে যে কনট্যুর তথ্য নিষ্কাশনে সিএনএন নেটওয়ার্ক অনুপস্থিত। বিগত দুই বছরে, অনেক গবেষক রি-আইডি গবেষণায় অংশগ্রহণের জন্য কনট্যুর তথ্যকে সহায়ক আইটেম হিসাবে ব্যবহার করতে শুরু করেছেন এবং কিছু সাফল্য অর্জন করেছেন।
উপরোক্ত বিদ্যমান তথ্যগুলির উপর ভিত্তি করে, আমরা বিশ্বাস করি যে CNN নেটওয়ার্কে কনট্যুর তথ্য যোগ করা কার্যকরভাবে তাদের আরও এবং আরও শক্তিশালী পথচারীদের তথ্য শিখতে সাহায্য করতে পারে এবং চূড়ান্ত স্বীকৃতির প্রভাবকে উন্নত করতে পারে। সিএনএন নেটওয়ার্কের এন্ড-টু-এন্ড গোপনীয়তার পরিপ্রেক্ষিতে, একজন মানুষের পূর্ব ধারণার সাথে হস্তক্ষেপ করতে পারে না। অতএব, আমরা মনোযোগের চিন্তার সাহায্যে একটি কনট্যুর তথ্য নিষ্কাশন মডিউল তৈরি করি, যাতে সিএনএন নেটওয়ার্ক মাল্টি-লেয়ার কনভোলিউশন প্রক্রিয়ায় এটি হারানোর পরিবর্তে কিছু কনট্যুর তথ্যের প্রতি আরও মনোযোগ দিতে পারে। মূলত, এই কাগজের অবদানগুলি নিম্নরূপ:
• আমরা সিএনএন নেটওয়ার্কে ব্যক্তিগতভাবে পুনরায় সনাক্তকরণ গবেষণায় কনট্যুর তথ্যের অভাব যাচাই করি।
• আমরা একটি কনট্যুর তথ্য নিষ্কাশন মডিউল প্রস্তাব করি, যা নেটওয়ার্ককে মানুষের অভিজ্ঞতার হস্তক্ষেপ ছাড়াই পথচারীদের চিত্রের কনট্যুর তথ্যের প্রতি আরও মনোযোগ দিতে পারে।
• পরীক্ষামূলক ফলাফলগুলি দেখায় যে আমাদের পদ্ধতিটি Market1501 এবং DukeMTMC-reID ডেটাসেটগুলিতে ভাল প্রভাব ফেলে৷

2. সম্পর্কিত কাজ
2.1। মনোযোগ প্রক্রিয়ার উপর ভিত্তি করে ব্যক্তির পুনরায় সনাক্তকরণ
সাম্প্রতিক বছরগুলিতে, মনোযোগের প্রক্রিয়া ব্যাপকভাবে ব্যবহৃত হয়েছে [15-18]। এর উদ্দেশ্য হল নেটওয়ার্ককে আরও গুরুত্বপূর্ণ জিনিস শিখতে সক্ষম করা। রি-আইডি রিসার্চ কার্যকরভাবে ভঙ্গি ভুল বিভাজন, পথচারীদের চিত্র বিচ্যুতি এবং আংশিক অবরোধের সমস্যা সমাধান করতে পারে। উদাহরণস্বরূপ, লিউ এট আল। [১৯] প্রথমবারের মতো রি-আইডি টাস্কের জন্য একটি মনোযোগ মডেল প্রস্তাব করেছে যাতে গতিশীলভাবে বিভিন্ন স্থানীয় এলাকা সনাক্ত করার জন্য মনোযোগ বৈশিষ্ট্য তৈরি করা যায়। ঝাও এট আল। [20] সিএনএন-এর উপর ভিত্তি করে একটি মনোযোগ মডেল প্রস্তাব করেছে, যা মিলনের জন্য ব্যবহৃত শরীরের অংশ শিখতে জোড়া মানব চিত্রের মিল তথ্য ব্যবহার করে। ওয়াং এট আল। [২১] কঠোর মনোযোগ এবং নরম মনোযোগের সমন্বয়ে একটি মনোযোগ মডেলের প্রস্তাব করেছেন, যা একই সাথে বহু-স্কেল স্থানীয় এবং পিক্সেল-স্তরের বৈশিষ্ট্য মানচিত্রগুলি শেষ-থেকে-শেষ পদ্ধতিতে শিখতে পারে। সান এট আল। [২২] একটি স্থানীয়-থেকে-গ্লোবাল মাল্টি-স্কেল অ্যাটেনশন নেটওয়ার্ক (LGMANet) প্রস্তাব করেছে, যা জন্ম নেটওয়ার্কের স্বীকৃতির ক্ষমতাকে আরও উন্নত করতে প্রসঙ্গ তথ্য এবং স্থানিক মনোযোগের তথ্যের পূর্ণ ব্যবহার করে। ঝাং এট আল। [২৩] একটি কার্যকর সম্পর্ক-সচেতন গ্লোবাল অ্যাটেনশন (RGA) মডিউল প্রস্তাব করেছে, যা দৃশ্য বিভাজন এবং চিত্র বিভাজন কাজগুলিতেও প্রয়োগ করা যেতে পারে।

2.2। কনট্যুর তথ্যের উপর ভিত্তি করে ব্যক্তি পুনরায় সনাক্তকরণ
সাম্প্রতিক বছরগুলিতে, কিছু গবেষক রি-আইডি গবেষণায় পথচারী কনট্যুর প্রয়োগ করেছেন; উদাহরণস্বরূপ, চেন এট আল। [২৪] প্রথমে গভীর রি-আইডি মডেলগুলিতে কনট্যুরটি স্পষ্টভাবে ব্যবহার করার চেষ্টা করেছিল এবং কনট্যুর নির্দেশিকা প্রস্তাব করেছিল, যা পথচারী কনট্যুরের প্রয়োগের সম্ভাবনাকে ব্যাপকভাবে প্রমাণ করে। ইয়াং এট আল। [২৫] বিশ্বাস করা হয়েছিল যে একজন ব্যক্তির পোশাকের পরিবর্তন শক্তিশালী নয় (শক্তিশালী বলতে শীতের পোশাক এবং গ্রীষ্মের পোশাকের মধ্যে ব্যবধান বোঝায়), পথচারী কনট্যুরও ব্যক্তিগত বৈশিষ্ট্যগুলিকে আলাদা করতে পারে। এর উপর ভিত্তি করে, পথচারী কনট্যুর মানচিত্রটি ক্রস-ড্রেসিং ব্যক্তি রি-আইডির জন্য বৈশিষ্ট্য নিষ্কাশনের ইনপুট হিসাবে ব্যবহৃত হয় এবং ভাল ফলাফল অর্জন করা হয়। ইয়াং এট আল এর গবেষণার উপর ভিত্তি করে, চেন এট আল। [26] মনোযোগ প্রক্রিয়ার সাথে মিলিত, ক্রস-ড্রেসিং রি-আইডি গবেষণা গবেষণা করার জন্য পথচারী কনট্যুর ব্যবহার করে। সম্প্রতি প্রকাশিত গবেষণা [27] পথচারীদের রঙ চিত্র বৈশিষ্ট্য এবং পথচারী কনট্যুর বৈশিষ্ট্যগুলির মধ্যে পারস্পরিক তথ্য সর্বাধিক করার জন্য একটি মাল্টি-স্কেল চেহারা এবং কনট্যুর ডিপ ইনফোম্যাক্স (MAC-DIM) প্রস্তাব করেছে, কনট্যুর বৈশিষ্ট্য শিক্ষাকে নিয়মিতকরণ হিসাবে ব্যবহার করে আরও কার্যকর আকৃতি-সচেতন বৈশিষ্ট্য উপস্থাপনা। রঙিন ছবি থেকে।
3. পদ্ধতি
এই বিভাগে, আমরা প্রস্তাবিত কনট্যুর ইনফরমেশন এক্সট্রাকশন মডিউল (CIEM) দেখাব (যেমন চিত্র 2 এ দেখানো হয়েছে), এবং কনট্যুর তথ্য এমবেডিং এর উপর ভিত্তি করে রি-আইডি পদ্ধতির বিশদ বিবরণ দেব (যেমন চিত্র 3 এ দেখানো হয়েছে)।

3.1। কনট্যুর তথ্য নিষ্কাশন মডিউল
পথচারী কনট্যুরে প্রাসঙ্গিক বৈশিষ্ট্য রয়েছে যা শেখার জন্য উপকারী, তবে সাধারণ CNN নেটওয়ার্ক কিছুটা হলেও তাদের উপেক্ষা করবে। পথচারী কনট্যুরে থাকা তথ্যের প্রতি নেটওয়ার্ককে আরও মনোযোগ দিতে সক্ষম করার জন্য, আমরা মনোযোগের ধারণা গ্রহণ করি এবং কনট্যুর তথ্য নিষ্কাশন মডিউলের প্রস্তাব করি। এর পরে, আমরা কনট্যুর তথ্য নিষ্কাশন মডিউল এবং এটি কীভাবে ব্যবহার করতে হয় তার বিশদ বিবরণ উপস্থাপন করব, যেমন চিত্র 2-এ দেখানো হয়েছে।
ডেটাসেটে পথচারী চিত্রের জন্য, কনভোল্যুশনের জন্য ResNet-50 ব্যবহার করার সময়, একটি অবশিষ্ট স্তরের পিছনে এর আউটপুট বৈশিষ্ট্য মানচিত্র F হিসাবে সেট করা হয় এবং এর আকার C x H W, যেখানে C হল চ্যানেলের সংখ্যা এবং H x W হল স্থানের আকার। পথচারী কনট্যুর শাখার জন্য, আমরা পথচারী কনট্যুর মানচিত্রের মাত্রা কমিয়ে দিই কনভোলিউশন স্তরের মাধ্যমে পথচারী চিত্রের সাথে সামঞ্জস্যপূর্ণ কনট্যুর ফিচার ম্যাপ F' ফিচার ম্যাপের মতো একই আকারের সাথে। এর আকার হল 1 H x W যেখানে 1 হল চ্যানেল নম্বর। H x W হল স্থানের আকার, এবং F এবং F' হল কনট্যুর তথ্য নিষ্কাশন মডিউলের ইনপুট।

3.2। সামগ্রিক আর্কিটেকচার
পূর্ববর্তী বিভাগে, আমরা বিস্তারিতভাবে কনট্যুর তথ্য নিষ্কাশন মডিউল চালু করেছি। এর পরে, আমরা সামগ্রিকভাবে কনট্যুর তথ্য এমবেডিংয়ের উপর ভিত্তি করে রি-আইডি পদ্ধতি চালু করব। আমরা প্রস্তাবিত সামগ্রিক কাঠামো চিত্র 3 এ দেখানো হয়েছে।
পুরো ফ্রেমটি যথাক্রমে দুটি ইনপুট সহ দুটি শাখায় বিভক্ত। মূল শাখার ইনপুট হল ডেটাসেটে RGB পথচারীর আসল ছবি, এবং কনট্যুর শাখার ইনপুট হল RGB মূল ছবির সাথে সঙ্গতিপূর্ণ পথচারী কনট্যুর ছবি।
মূল শাখায়, আমরা ব্যাকবোন নেটওয়ার্ক হিসাবে ResNet-50 ব্যবহার করি, যা সাধারণত পাঁচটি ভাগে বিভক্ত, যথা, একটি কনভোলিউশন লেয়ার কনভ1 এবং চারটি অবশিষ্ট স্তর।
কনট্যুর শাখা প্রধানত পাঁচটি কনভোলিউশন লেয়ার এবং চারটি কনট্যুর তথ্য নিষ্কাশন মডিউল নিয়ে গঠিত। কনট্যুর ম্যাপের প্রাথমিক মাত্রা হ্রাস করার জন্য কনট্যুর শাখার সামনে কনভোলিউশন লেয়ারের মতো একই কনভ1 প্যারামিটার সহ একটি কনভোলিউশন লেয়ার স্থাপন করা হয়। আমরা ResNet-50-এর প্রতিটি অবশিষ্ট স্তরের আউটপুট অবস্থানে একটি কনট্যুর তথ্য নিষ্কাশন মডিউল যোগ করি এবং কনট্যুর তথ্য নিষ্কাশন মডিউলের আগে একটি কনভোলিউশন স্তর রাখি। কনভোলিউশন লেয়ারের ইনপুট ডাইমেনশন হল 1, আউটপুট ডাইমেনশন হল 1, কার্নেল_ সাইজ=1, এবং স্টেপ সাইজ হল 2, যা কনট্যুর ফিচার ম্যাপের ডাইমেনশন কমাতে ব্যবহৃত হয়।
আমাদের পরীক্ষায় ব্যবহৃত প্রশিক্ষণ পদ্ধতিটি বেশিরভাগ রি-আইডি গবেষণায় ব্যবহৃত হয়। পরীক্ষায় ব্যবহৃত ক্ষতি ফাংশন হল সফটম্যাক্স লস এবং হার্ড স্যাম্পল মাইনিং (ট্রাইহার্ড লস) [২৮], যাকে আমরা যথাক্রমে LID এবং LT হিসাবে প্রকাশ করি। ব্যাকবোন চরিত্রগত মানচিত্র গ্রহণ করার পরে, এটি একটি গড় পুলিং স্তরের মাধ্যমে চরিত্রগত ভেক্টর গ্রহণ করে। ভেক্টরটি BN স্তরের মধ্য দিয়ে যাওয়ার পরে, এটি লস ফাংশন LT গণনা করে এবং এর গণনার সূত্রটি হল:
![]()
যেখানে P একটি ব্যাচের ব্যক্তি আইডির সংখ্যা উপস্থাপন করে, এলোমেলোভাবে প্রতিটি ব্যক্তির আইডির জন্য K ছবি নির্বাচন করে। A নোঙ্গর বিন্দু প্রতিনিধিত্ব করে, p ইতিবাচক নমুনা প্রতিনিধিত্ব করে, এবং n নেতিবাচক নমুনা প্রতিনিধিত্ব করে। A হল ইতিবাচক নমুনার সেট এবং B হল নেতিবাচক নমুনার সেট। maxda,p সবচেয়ে কঠিন ইতিবাচক নমুনাকে উপস্থাপন করে এবং maxda,n সবচেয়ে কঠিন নেতিবাচক নমুনাকে উপস্থাপন করে। মানে মার্জিন এবং সেট করা আছে 0.3।
লস ফাংশন LID রৈখিক স্তরের মাধ্যমে BN স্তর আউটপুট থেকে প্রাপ্ত eigenvector দ্বারা গণনা করা হয়, গণনার সূত্রটি হল:

4. পরীক্ষা
এই অধ্যায়ে, আমরা পরীক্ষামূলক ফলাফল থেকে প্রস্তাবিত পদ্ধতির কার্যকারিতা প্রমাণ করব। অতএব, আমরা নির্মূল পরীক্ষার একটি সিরিজ ডিজাইন করেছি। এই কাগজে পদ্ধতির সার্বজনীনতা যাচাই করার জন্য প্রস্তাবিত মডেলটিকে Market1501 এবং DukeMTMC-reID ডেটাসেটে পরীক্ষা করা হবে। সাম্প্রতিক বছরগুলিতে রি-আইডি গবেষণায় উন্নত পদ্ধতির সাথে আমাদের পদ্ধতির তুলনা করে, আমাদের পদ্ধতিতে এখনও একটি নির্দিষ্ট প্রতিযোগিতা রয়েছে।
4.1। ডেটাসেট এবং বাস্তবায়নের বিবরণ
আমরা দুটি ডেটাসেট নির্বাচন করেছি যা পরীক্ষার জন্য রি-আইডি গবেষণায় সবচেয়ে বেশি ব্যবহৃত হয়। মার্কেট1501 ডেটাসেট [29]টিতে 1,501টি ভিন্ন পথচারী আইডি, প্রশিক্ষণ সেটে 751টি পথচারী আইডি এবং পরীক্ষা সেটে 750টি পথচারী আইডি রয়েছে, মোট 32,217টি ছবি রয়েছে৷ DukeMTMC-reID ডেটাসেট [30]টিতে 1812টি ভিন্ন পথচারী আইডি, প্রশিক্ষণ সেটে 702টি পথচারী আইডি এবং পরীক্ষা সেটে 1110টি পথচারী আইডি রয়েছে। তাদের মধ্যে, আমরা প্রধানত Market1501 এবং DukeMTMC-reID ডেটাসেটগুলির সাথে অ্যাবলেশন পরীক্ষাকে উল্লেখ করি। পরীক্ষায়, আমরা ডেটাসেটের কনট্যুর বের করতে এবং পথচারী কনট্যুর ডেটাসেট তৈরি করতে RCF মডেল ব্যবহার করি।
নেটওয়ার্ক প্রশিক্ষণের আগে, আমরা র্যান্ডম ক্লিপিং, অনুভূমিক ফ্লিপিং এবং অন্যান্য সাধারণ ইমেজ বর্ধিতকরণ ক্রিয়াকলাপ সহ RGB আসল চিত্র এবং পথচারী কনট্যুর চিত্রগুলিতে ডেটা বর্ধিতকরণ ক্রিয়াকলাপ সম্পাদন করব এবং বিভিন্ন ডেটাসেটকে একীভূত করার জন্য, আমরা ইনপুট চিত্রগুলিকে 256 × 128 পিক্সেলে সামঞ্জস্য করি। প্রশিক্ষণ প্রক্রিয়ায়, আমরা শেখার হার 8 × 10−4, ওজন ক্ষয় হার 5 × 10−4, প্রশিক্ষণ চক্র 600 এবং ব্যাচের আকার 32 এ সেট করতে অ্যাডাম অপ্টিমাইজার ব্যবহার করি। প্রশিক্ষণের পরে, বাছাই অপ্টিমাইজ করার জন্য আমরা রি-র্যাঙ্কিংয়ের মতো পদ্ধতি ব্যবহার করিনি। পরীক্ষার পর্বে, আমরা Re-ID-তে বেশিরভাগ গবেষণার মতো কর্মক্ষমতা মূল্যায়ন করতে র্যাঙ্ক 1-এর ক্রমবর্ধমান ম্যাচিং বৈশিষ্ট্য (CMC) [31] এবং গড় নির্ভুলতা (mAP) [29] ব্যবহার করেছি।
4.2। অবলেশন স্টাডি
4.2.1। কনট্যুর তথ্যের প্রয়োজনীয়তা
দুটি ভিন্ন বেসলাইন মডেলে, আমরা সরাসরি পথচারী কনট্যুর মানচিত্রটিকে বৈশিষ্ট্য মানচিত্র হিসাবে নেটওয়ার্কের মাঝের স্তরে এম্বেড করতে ব্যবহার করি এবং এটিকে কনট্যুর এম্বেডিং পদ্ধতি (CEM) নাম দিই। এই দুটি ভিন্ন বেসলাইন মডেলের নাম বেসলাইন 1 এবং বেসলাইন 2। বেসলাইন1 হল একটি দুর্বল বেসলাইন মডেল, এর ব্যাকবোন নেটওয়ার্ক হল ResNet-50, এবং শেষ অবশিষ্ট স্তরের মাত্রা হ্রাস অপারেশন সংরক্ষিত। নেটওয়ার্ক প্রশিক্ষণের আগে ImageNet-এ প্রাক-প্রশিক্ষিত প্যারামিটার ব্যবহার করুন। বেসলাইন 2 একটি শক্তিশালী বেসলাইন মডেল। এর ব্যাকবোন নেটওয়ার্ক হল ResNet-50, যা শেষ অবশিষ্ট স্তরের মাত্রা হ্রাস অপারেশনকে সরিয়ে দেয়। প্রশিক্ষণের আগে, নেটওয়ার্ক প্রাক-প্রশিক্ষিত প্যারামিটার ব্যবহার করে যা রি-আইডি গবেষণার জন্য আরও উপযুক্ত। নির্দিষ্ট অপারেশন হল পথচারী কনট্যুর মানচিত্রটিকে রেসনেটের চারটি অবশিষ্ট স্তরের আউটপুট অবস্থানে এমবেড করা-50 কনভল্যুশন লেয়ারের মাধ্যমে মাত্রা হ্রাসের পরে উপাদান-স্তর যোগ করার উপায়ে, যাচাই করার জন্য যে CNN নেটওয়ার্ক উপেক্ষা করে চিত্র বৈশিষ্ট্য নিষ্কাশন প্রক্রিয়ার কনট্যুর তথ্য. সারণি 1 আমাদের দুর্বল বেসলাইন1, বেসলাইন1-CEM, আরও শক্তিশালী বেসলাইন2, এবং বেসলাইন2-CEM-এর পরীক্ষামূলক ডেটা দেখায়, আমরা নিম্নলিখিত পর্যবেক্ষণগুলি পেতে পারি:
1. রি-আইডির উপর আমাদের গবেষণায়, সিএনএন নেটওয়ার্কে কনট্যুর বৈশিষ্ট্য এবং কনট্যুর তথ্যের প্রকাশের অভাব রয়েছে। এটি বেসলাইন1 এবং বেসলাইন1+সিইএম-এর মধ্যে তুলনা থেকে দেখা যায়। যদিও চূড়ান্ত স্বীকৃতি হার খুব বেশি নয়, কনট্যুর মানচিত্র যোগ করার প্রভাব স্পষ্ট। উদাহরণস্বরূপ, Market1501 ডেটাসেটে, CEM-এর সাথে যুক্ত বেসলাইন1 মানচিত্রে 0.8% বেশি এবং র্যাঙ্কে 1.3% বেশি-1 আসলটির থেকে;
2. শক্তিশালী বেসলাইন 2-এর জন্য, সম্ভবত নেটওয়ার্ক প্রাক-প্রশিক্ষিত পরামিতিগুলির অপ্টিমাইজেশনের কারণে, CEM পদ্ধতি নেটওয়ার্কের চূড়ান্ত স্বীকৃতির হারকে উন্নত করতে পারে না এবং সরাসরি কনট্যুর মানচিত্র ব্যবহার করার পদ্ধতিটি কার্যকরভাবে CNN নেটওয়ার্ককে মনোযোগ দিতে পারে না। আরো কনট্যুর তথ্য, এটি এমনকি মূল স্বীকৃতি কর্মক্ষমতা কমিয়ে দেবে. নেটওয়ার্ককে শক্তিশালী বেসলাইনে কনট্যুর তথ্যের প্রতি মনোযোগ দিতে, কনট্যুর তথ্য নিষ্কাশন মডিউল প্রস্তাব করা হয়েছে।

4.2.2। CIEM যোগ করার জন্য অবস্থান নির্বাচন করুন
বিদ্যমান কনভোলিউশনাল নিউরাল নেটওয়ার্কের বৈশিষ্ট্য থেকে, একটি চিত্রের মধ্যে থাকা প্রান্ত, কনট্যুর এবং অন্যান্য বৈশিষ্ট্যের তথ্য হল সমস্ত অগভীর বৈশিষ্ট্যের অভিব্যক্তি, এবং CNN নেটওয়ার্কের প্রতিটি স্তরের বৈশিষ্ট্য মানচিত্রের ভিজ্যুয়ালাইজেশন ফলাফলগুলিও একই। সুতরাং, কনট্যুর তথ্য নিষ্কাশন মডিউলটি কোথায় রাখবেন এবং কীভাবে এটি ব্যবহার করবেন তা যাচাই করার জন্য নিম্নলিখিত পরীক্ষাগুলি প্রয়োজন। আমরা ResNet-50 এর চারটি অবশিষ্ট স্তরের আউটপুট অবস্থানে কনট্যুর তথ্য নিষ্কাশন মডিউল ব্যবহার করব এবং এই চারটি অবস্থানের নাম রাখব L1-L4। পরীক্ষামূলক ফলাফলগুলি সারণি 2 এ দেখানো হয়েছে এবং আমরা নিম্নলিখিত পর্যবেক্ষণগুলি পেতে পারি।

কনট্যুর তথ্য নিষ্কাশন মডিউল ব্যবহার করার পদ্ধতি পরীক্ষার আগে অনুমান থেকে বেশ ভিন্ন. পরীক্ষামূলক তথ্য থেকে, যখন আমরা প্রথম তিনটি অবশিষ্ট স্তরের পরে কনট্যুর তথ্য নিষ্কাশন মডিউল যোগ করি, তখন পরীক্ষামূলক ফলাফলের উন্নতি সুস্পষ্ট নয়। একটি উদাহরণ হিসাবে Market1501 ডেটাসেট নিলে, L1 এবং L2 আউটপুট অবস্থানগুলিতে ব্যবহৃত কনট্যুর তথ্য নিষ্কাশন মডিউলের চূড়ান্ত র্যাঙ্ক 1 হল 94.3%, এবং L1, L2 এবং L3 আউটপুট অবস্থানগুলিতে ব্যবহৃত কনট্যুর তথ্য নিষ্কাশন মডিউলের চূড়ান্ত র্যাঙ্ক 1 94.5%; এই দুটি পদ্ধতির স্বীকৃতি প্রভাব বেসলাইন মডেলের তুলনায় ভাল, তবে উন্নতি বড় নয় এবং ফলাফলগুলি একই রকম। যখন কনট্যুর তথ্য নিষ্কাশন মডিউলটি চারটি অবশিষ্ট স্তরের পরে ব্যবহার করা হয়, তখন নেটওয়ার্কের চূড়ান্ত স্বীকৃতি প্রভাব র্যাঙ্ক1-এ 83.8% এবং মানচিত্রে 95.1% হয়, যা আগের দুটির তুলনায় উল্লেখযোগ্যভাবে উন্নত, এবং আমরা বেসলাইন মডেলকেও ছাড়িয়ে যায় ব্যবহার অতএব, আমরা এই নিবন্ধের চূড়ান্ত মডেল আর্কিটেকচার প্রাপ্ত.

প্রথমত, বেসলাইন মডেলের সাথে তুলনা করে, আমাদের পদ্ধতি এখনও একটি অত্যন্ত শক্তিশালী বেসলাইন মডেলের চূড়ান্ত স্বীকৃতি প্রভাব উন্নত করতে পারে; একটি উদাহরণ হিসাবে Market15{10}}1 ডেটাসেট নিলে, আমাদের পদ্ধতিটি এমএপি-তে বেসলাইন মডেলের থেকে 1.7% বেশি এবং র্যাঙ্কের বেসলাইন মডেল থেকে 1.3% বেশি-1৷ অধিকন্তু, ক্লাসিক্যাল রি-আইডি অ্যালগরিদম, যেমন SVDNet, PCB, ইত্যাদির সাথে তুলনা করে, আমাদের পদ্ধতি একটি শক্তিশালী প্রতিযোগিতামূলক সুবিধা দেখিয়েছে এবং এমএপি এবং র্যাঙ্ক-1, দুটি সাধারণভাবে ব্যবহৃত সূচকে সম্পূর্ণ সুবিধা রয়েছে। সাম্প্রতিক বছরগুলিতে প্রস্তাবিত আরও কিছু উন্নত পদ্ধতির সাথে তুলনা করে, আমাদের পদ্ধতির কিছু পরিমাণে এর সুবিধা রয়েছে। ডেটাসেট Market1501-এর প্রাসঙ্গিক পরীক্ষায়, আমাদের পদ্ধতির সূচক র্যাঙ্কে একটি নির্দিষ্ট সুবিধা রয়েছে-1, উদাহরণস্বরূপ, BoT, DGNet এবং অন্যান্য পদ্ধতির তুলনায়, আমাদের পদ্ধতির এখনও প্রায় 0.5% সুবিধা রয়েছে৷ নির্দেশক এমএপি-র পরিপ্রেক্ষিতে, আমাদের পদ্ধতি এখনও বেশিরভাগের সাথে তুলনীয়, তবে ডিজি-নেটের তুলনায় এখনও একটি নির্দিষ্ট ফাঁক রয়েছে। ডেটাসেটে DukeMTMC-reID, এই পদ্ধতি দ্বারা উপস্থাপিত ফলাফল এখনও একই। আমাদের পদ্ধতির মূল্যায়ন সূচক র্যাঙ্কের ক্ষেত্রে অন্যান্য পদ্ধতির থেকে কিছু সুবিধা রয়েছে, কিন্তু এটি এমএপি-র পরিপ্রেক্ষিতে সন্তোষজনক নয়, যা আমাদের পরবর্তী গবেষণা ও উন্নতির দিকনির্দেশনাও। বাকিদের জন্য, আমাদের পদ্ধতিটি পুনঃর্যাঙ্কিং প্রযুক্তি ব্যবহার করে না, তবে ক্যাম এবং ডেয়ারের মতো রির্যাঙ্কিং প্রযুক্তি ব্যবহার করে অন্যান্য পদ্ধতির সাথে তুলনা করে, আমাদের পদ্ধতির এখনও কিছু সুবিধা রয়েছে।
5। উপসংহার
এই কাগজে, আমরা কনট্যুর তথ্য এম্বেডিংয়ের উপর ভিত্তি করে একটি রি-আইডি পদ্ধতি প্রস্তাব করি। মনোযোগের প্রক্রিয়া এবং CNN বৈশিষ্ট্য মানচিত্র এবং কনট্যুর মানচিত্রের মধ্যে সম্পর্কের ধারণার সাথে, কনট্যুর তথ্য নিষ্কাশন মডিউলটি তৈরি করা হয়েছে। আমরা ResNet-50 ব্যবহার করি, যেটি ব্যাকবোন নেটওয়ার্ক হিসাবে রি-আইডি গবেষণায় সবচেয়ে বেশি ব্যবহৃত হয় এবং কনট্যুর তথ্য নিষ্কাশন মডিউলটি এর অবশিষ্ট স্তর আউটপুট অবস্থানে ব্যবহার করি যাতে নেটওয়ার্ক কনট্যুরের দিকে আরও মনোযোগ দিতে পারে। বৈশিষ্ট্য নিষ্কাশন প্রক্রিয়ায় তথ্য. আমাদের পদ্ধতি একটি যুগান্তকারী যা কনট্যুর তথ্য ব্যবহার করার চেষ্টা করে, এবং এটি এখনও একটি খুব শক্তিশালী বেসলাইন নেটওয়ার্কে একটি খুব ভাল স্বীকৃতি প্রভাব অর্জন করতে পারে। কনট্যুর তথ্যের ব্যবহার এখানেই সীমাবদ্ধ নয়, এবং আমরা পথচারীদের স্বীকৃতির ক্ষেত্রে পথচারী কনট্যুর নিয়ে আরও গবেষণা করার আশা করি।
লেখকের অবদান:
ধারণা, HC, এবং YZ; পদ্ধতি, HC; বৈধতা, HC, YZ, এবং SW; আনুষ্ঠানিক বিশ্লেষণ, SW; তদন্ত, SW; সম্পদ, YZ এবং SW; ডেটা কিউরেশন, HC; লেখা—মূল খসড়া প্রস্তুতি, HC; লেখা—পর্যালোচনা এবং সম্পাদনা, YZ এবং SW সমস্ত লেখক পাণ্ডুলিপির প্রকাশিত সংস্করণ পড়েছেন এবং সম্মত হয়েছেন।
অর্থায়ন:
এই কাজটি চীনের ন্যাশনাল ন্যাচারাল সায়েন্স ফাউন্ডেশন (No.61631009, No.61771220), এবং চীনের জাতীয় কী R&D প্রোগ্রাম (No.2017YFB1002900, No.2017YFB0404800) দ্বারা সমর্থিত।
প্রাতিষ্ঠানিক পর্যালোচনা বোর্ডের বিবৃতি:
প্রযোজ্য নয়।
অবহিত সম্মতি বিবৃতি:
প্রযোজ্য নয়।
ডেটা উপলব্ধতা বিবৃতি:
প্রযোজ্য নয়।

স্বার্থের সংঘাত:
লেখক আগ্রহের কোন দ্বন্দ্ব ঘোষণা।
তথ্যসূত্র
1. ইয়ে, এম; শেন, জে.; লিন, জি.; জিয়াং, টি.; Hoi, S. ডিপ লার্নিং ফর পারসন রি-আইডেন্টিফিকেশন: একটি সার্ভে অ্যান্ড আউটলুক। IEEE ট্রান্স। প্যাটার্ন মলদ্বার. মাখ। বুদ্ধি। 2021, 44, 2872–2893। [ক্রসরেফ] [পাবমেড]
2. ঝাং, এল.; লি, ডব্লিউ; ইউ, এল.; সূর্য, এল.; Ning, X. GmFace: মুখের চিত্র উপস্থাপনের জন্য একটি স্পষ্ট ফাংশন। 2021, 68, 102022 প্রদর্শন করে। [CrossRef]
3. নিউ, সি.; নান, এফ.; Wang, X. 3DDFA এবং CBAM ভিত্তিক একটি সুপার-রেজোলিউশন ফ্রন্টাল ফেস জেনারেশন মডেল। 2021, 69, 102043 প্রদর্শন করে। [CrossRef]
4. রুয়ান, এলএইচ; হান, YX; সান, জেআর; চেন, QC; লি, জেকিউ ফেসিয়াল এক্সপ্রেশন রিকগনিশন ইন ফেসিয়াল অক্লুশন পরিস্থিতিতে: একটি পথ নির্বাচন মাল্টি-নেটওয়ার্ক। 2022, 74, 102245 প্রদর্শন করে। [CrossRef]
5. চেন, কিলোওয়াট; লাই, সিসি; লি, পিজে; চেন, সিএস; হুয়াং, একাধিক নন-ওভারল্যাপিং ক্যামেরা জুড়ে টার্গেট ট্র্যাকিং এবং ট্রু লিঙ্কিং আবিষ্কারের জন্য YP অভিযোজিত শিক্ষা। IEEE ট্রান্স। মাল্টিমিড। 2011, 13, 625-638। [ক্রসরেফ]
6. খামিস, এস.; কুও, সিএইচ; সিং, ভিকে; শেট, ভিডি; ডেভিস, অ্যাট্রিবিউট-সামঞ্জস্যপূর্ণ ব্যক্তি পুনরায় সনাক্তকরণের জন্য LS জয়েন্ট লার্নিং। কম্পিউটার ভিশন, জুরিখ, সুইজারল্যান্ড, 6-12 সেপ্টেম্বর 2014-এর ইউরোপীয় সম্মেলনের কার্যক্রমে; পৃষ্ঠা 134-146।
7. ইয়াং, এক্স।; ওয়াং, এম.; Tao, D. বিশেষাধিকারপ্রাপ্ত তথ্য ব্যবহার করে মেট্রিক শিক্ষার সাথে ব্যক্তি পুনরায় সনাক্তকরণ। IEEE ট্রান্স। ইমেজ প্রক্রিয়া. 2018, 27, 791–805। [ক্রসরেফ] [পাবমেড]
8. সূর্য, Y.; ঝেং, এল.; ইয়াং, ওয়াই।; তিয়ান, প্র.; Wang, S. Beyond Part Models: Person Retrieval with Refined Part Pooling. কম্পিউটার ভিশন, মিউনিখ, জার্মানি, 8-14 সেপ্টেম্বর 2018-এর ইউরোপীয় সম্মেলনের কার্যক্রমে; পৃষ্ঠা 501-518।
9. ঝাও, এইচ.; তিয়ান, এম.; সান, এস.; জিং, এস.; ট্যাং, এক্স স্পিন্ডল নেট: মানবদেহের অঞ্চল নির্দেশিত বৈশিষ্ট্যের পচন এবং ফিউশন সহ ব্যক্তি পুনঃপরিচয়। 2017 IEEE কনফারেন্স অন কম্পিউটার ভিশন অ্যান্ড প্যাটার্ন রিকগনিশন (CVPR), হনলুলু, HI, USA, 21-26 জুলাই 2017; পৃষ্ঠা 907-915।
10. ঝু, জে.; ইয়াং, এইচ.; ওয়াং, জে.; ঝাং, ডব্লিউ. বর্ণনা-ভিত্তিক ব্যক্তি মাল্টি-গ্রেইনড ম্যাচিং নেটওয়ার্কের সাথে অনুসন্ধান করুন। 2021, 69, 102039 প্রদর্শন করে। [CrossRef]
11. গুও, এন.; ডি, কে.; লিউ, এইচ.; ওয়াং, ওয়াই.; কিয়াও, জে. একটি মেট্রিক-ভিত্তিক মেটা-লার্নিং পদ্ধতির সম্মিলিত মনোযোগের প্রক্রিয়া এবং কয়েকটি শট শেখার জন্য এনসেম্বল লার্নিং। ডিএসপি টেকনোল। আবেদন 2021, 70, 102065। [ক্রসরেফ]
12. গেইরহোস, আর.; রুবিশ, পি.; মাইকেলিস, সি.; বেথগে, এম.; উইচম্যান, এফএ; ব্রেন্ডেল, ডব্লিউ. ইমেজনেট-প্রশিক্ষিত সিএনএন টেক্সচারের প্রতি পক্ষপাতদুষ্ট; ক্রমবর্ধমান আকৃতির পক্ষপাত নির্ভুলতা এবং দৃঢ়তা উন্নত করে। শেখার প্রতিনিধিত্বের আন্তর্জাতিক সম্মেলনের কার্যপ্রণালীতে, নিউ অরলিন্স, এলএ, ইউএসএ, 6-9 মে 2019।
13. জিয়াং, জেড.; ইউয়ান, ওয়াই.; ওয়াং, প্র. অভিযোজিত গভীরতার মাধ্যমে শব্দার্থিক বিভাজনের জন্য কনট্যুর-সচেতন নেটওয়ার্ক। নিউরোকম্পিউটিং 2018, 284, 27-35। [ক্রসরেফ]
14. ওয়েই, এক্সএল; হু, বিওয়াই; গাও, টিএস; ওয়াং, জে.; ডেং, বি. টেক্সচার স্বীকৃতির জন্য মাল্টি-স্কেল কনভোলিউশনাল নিউরাল নেটওয়ার্ক। 2022, 75, 102324 প্রদর্শন করে। [CrossRef]
15. রু, এইচএ; লেই, এমএ; ঝ, বি.; Xc, C. T-GAN: অভিযোজিত গ্রাফ কনভোল্যুশন এবং মনোযোগের প্রক্রিয়া সহ অস্থায়ী জটিল নেটওয়ার্কগুলির পূর্বাভাসের জন্য একটি গভীর শিক্ষার কাঠামো। 2021, 68, 102023 প্রদর্শন করে।
For more information:1950477648nn@gmail.com






