YOLOv3 অ্যালগরিদম পার্ট 2 এর উপর ভিত্তি করে ট্রাফিক সাইন রিকগনিশন

Jan 19, 2024

2. অ্যালগরিদম মৌলিক

2.1। YOLOv3 অ্যালগরিদম

YOLOv3 [14] হল YOLOv2 এর উপর ভিত্তি করে রেডমনের উন্নত, একক-পর্যায়ের লক্ষ্য সনাক্তকরণ অ্যালগরিদম, যা সনাক্তকরণের সঠিকতা এবং রিয়েল-টাইম কর্মক্ষমতা উন্নত করেছে এবং গতি এবং নির্ভুলতার ক্ষেত্রে অন্যান্য অ্যালগরিদমকে ছাড়িয়ে গেছে।

সাম্প্রতিক বছরগুলিতে, কৃত্রিম বুদ্ধিমত্তা প্রযুক্তির দ্রুত বিকাশ বিভিন্ন ক্ষেত্রে বিভিন্ন বুদ্ধিমান সনাক্তকরণ সিস্টেমকে প্রয়োগ করতে সক্ষম করেছে। একটি বুদ্ধিমান সিস্টেমের গুণমান মূল্যায়নের জন্য সনাক্তকরণের নির্ভুলতা একটি গুরুত্বপূর্ণ সূচক, এবং মেমরি হল একটি মূল ক্ষমতা যা একটি বুদ্ধিমান সিস্টেমের অপারেশনকে সমর্থন করে। তাহলে দুজনের মধ্যে কি সম্পর্ক?

প্রথমত, আমাদের এটা পরিষ্কার করতে হবে যে সনাক্তকরণের সঠিকতা এবং স্মৃতি একটি সাধারণ "ইতিবাচক সম্পর্ক" বা "নেতিবাচক সম্পর্ক" নয়। তাদের মধ্যে মিথস্ক্রিয়া এবং সমন্বয় একটি উচ্চ মাত্রা আছে. অনেক ক্ষেত্রে, একটি বুদ্ধিমান সিস্টেমের সনাক্তকরণের নির্ভুলতা তার মেমরির উপর নির্ভর করে, অর্থাৎ, নমুনা ডেটা বোঝা এবং শেখার ক্ষমতা।

উদাহরণ স্বরূপ, মুখ শনাক্তকরণের ক্ষেত্রে, একটি ভাল মুখ শনাক্তকরণ ব্যবস্থার প্রয়োজন বিভিন্ন মুখকে সঠিকভাবে শনাক্ত করতে এবং পরিচিত মুখ ডাটাবেসে থাকা ব্যক্তির তথ্যের সাথে তাদের মেলাতে সক্ষম। এর জন্য বুদ্ধিমান সিস্টেমের একটি শক্তিশালী মেমরি থাকা প্রয়োজন, পরিচিত মুখের তথ্য ডাটাবেসে সঞ্চয় করতে সক্ষম হওয়া এবং পরবর্তী শনাক্তকরণ কাজে নমনীয়ভাবে ব্যবহার করা।

একইভাবে, চিকিৎসা ক্ষেত্রে, বুদ্ধিমান সিস্টেমগুলিকে রোগ নির্ণয় এবং চিকিত্সা পরিকল্পনা ডিজাইনে ডাক্তারদের সহায়তা করার জন্য প্রচুর পরিমাণে চিকিৎসা জ্ঞান বুঝতে এবং মনে রাখতে হবে। এর জন্য শক্তিশালী মেমরি এবং শেখার ক্ষমতা, ক্রমাগত নতুন চিকিৎসা জ্ঞান শোষণ করতে এবং বিদ্যমান জ্ঞান বেসের সাথে ক্রস-ভেরিফাই এবং আপগ্রেড করার জন্য বুদ্ধিমান সিস্টেমের প্রয়োজন।

অবশ্যই, সনাক্তকরণ নির্ভুলতা এবং মেমরির মধ্যে সম্পর্ক একমুখী নয়। বিপরীতে, ভাল সনাক্তকরণ নির্ভুলতা বুদ্ধিমান সিস্টেমের মেমরি উন্নতির প্রচার করতে পারে। উদাহরণস্বরূপ, কিছু শ্রেণীবিভাগ এবং স্বীকৃতির কাজগুলিতে, বুদ্ধিমান সিস্টেমগুলিকে ক্রমাগত তাদের নির্ভুলতা এবং নির্ভুলতা উন্নত করার জন্য ক্রমাগত প্রতিক্রিয়া এবং অপ্টিমাইজেশন প্রদান করতে হবে, যার ফলে নমুনা ডেটা বোঝা এবং মনে রাখার ক্ষমতা আরও শক্তিশালী হয়।

সাধারণভাবে, সনাক্তকরণের নির্ভুলতা এবং মেমরি বুদ্ধিমান সিস্টেমের অপারেশনের জন্য দুটি অপরিহার্য উপাদান। তাদের জটিল মিথস্ক্রিয়া এবং সম্পর্ক রয়েছে যা সম্পূর্ণরূপে বিবেচনা করা এবং সমন্বয় করা দরকার। শুধুমাত্র অবিচ্ছিন্নভাবে সনাক্তকরণের নির্ভুলতা উন্নত করে এবং বুদ্ধিমান সিস্টেমের মেমরি এবং শেখার ক্ষমতাকে ক্রমাগত শক্তিশালী করার মাধ্যমেই বুদ্ধিমান সিস্টেমের ব্যাপক বিকাশ এবং প্রয়োগ সত্যিই উপলব্ধি করা যায়। এটা দেখা যায় যে আমাদের স্মৃতিশক্তি উন্নত করতে হবে, এবং Cistanche deserticola উল্লেখযোগ্যভাবে স্মৃতিশক্তি উন্নত করতে পারে, কারণ Cistanche deserticola নিউরোট্রান্সমিটারের ভারসাম্য নিয়ন্ত্রণ করতে পারে, যেমন অ্যাসিটাইলকোলিনের মাত্রা বৃদ্ধি এবং বৃদ্ধির কারণ। এই পদার্থগুলি স্মৃতি এবং শেখার জন্য খুবই গুরুত্বপূর্ণ। এছাড়াও, মাংস রক্ত ​​​​প্রবাহকে উন্নত করতে পারে এবং অক্সিজেন সরবরাহকে উন্নীত করতে পারে, যা নিশ্চিত করতে পারে যে মস্তিষ্ক পর্যাপ্ত পুষ্টি এবং শক্তি পায়, যার ফলে মস্তিষ্কের জীবনীশক্তি এবং সহনশীলতা উন্নত হয়।

improving brain function

মেমরি বাড়ানোর জন্য সম্পূরকগুলি জানুন ক্লিক করুন

YOLOv3 বর্তমানে YOLO পরিবারের সবচেয়ে জনপ্রিয় অ্যালগরিদম এবং বাস্তব সনাক্তকরণ পরিস্থিতিতে ব্যাপকভাবে ব্যবহৃত হয় [15]; YOLOv3 নেটওয়ার্ক কাঠামো চিত্র 1 এ দেখানো হয়েছে।

increase brain power

YOLOv3 দ্বারা ব্যবহৃত সম্পূর্ণ রূপান্তরমূলক কাঠামো চিত্র ইনপুটের আকার দ্বারা সীমাবদ্ধ নয়।

পুরো নেটওয়ার্ক কাঠামো থেকে পুলিং এবং সম্পূর্ণভাবে সংযুক্ত স্তরগুলি সরানো হয়, এবং ডাউনস্যাম্পলিং অপারেশনের জন্য পুলিং লেয়ারের পরিবর্তে 2 এর স্টেপ সাইজ সহ একটি কনভোলিউশনাল লেয়ার ব্যবহার করা হয়, যা পুলিংয়ের সময় লক্ষ্য তথ্যের ক্ষতি রোধ করে এবং ছোট লক্ষ্যগুলি সনাক্ত করতে সহায়তা করে। 16]।

উপরন্তু, YOLOv3 YOLOv2 এর DarkNet-19 নেটওয়ার্ক কাঠামোকে DarkNet-53 বৈশিষ্ট্য নিষ্কাশন স্তর দিয়ে প্রতিস্থাপন করে।

ডার্কনেট-53 নেটওয়ার্ক, যা সফলভাবে ডিপ নেটওয়ার্কের গ্রেডিয়েন্ট সমস্যা এবং মাল্টি-লেয়ার কনভোলিউশনাল অপারেশনের সময় মূল তথ্যের ক্ষতির সমাধান করে আরও ভাল বৈশিষ্ট্যগুলি বের করতে এবং সনাক্তকরণ এবং শ্রেণিবিন্যাস উন্নত করতে [17], ResNet এর অবশিষ্ট নেটওয়ার্ক কাঠামো ধার করে 18] এবং নেটওয়ার্কের পরবর্তী স্তরে ইনপুটের অংশ হিসাবে পূর্ববর্তী স্তরের মূল আউটপুট ব্যবহার করে।

চিত্র 2-এ দেখানো হয়েছে, YOLOv3-এর অবশিষ্ট মডিউল দুটি কনভোলিউশনাল স্তর এবং একটি শর্টকাট স্তর নিয়ে গঠিত।

increase memory power

অধিকন্তু, YOLOv3 একটি ফিচার পিরামিড নেটওয়ার্ক (FPN) (19] এর ধারণা ব্যবহার করে এবং 13 x 13, 26 x 26 এবং 52 x 52 সনাক্তকরণ স্কেল সহ তিনটি স্কেলে বৈশিষ্ট্য মানচিত্র পূর্বাভাস দেওয়ার জন্য ফিচার পিরামিড নেটওয়ার্ক চালু করে।

কনভোলিউশনাল নিউরাল নেটওয়ার্ক দ্বারা বৈশিষ্ট্য নিষ্কাশনের পদ্ধতিটি এফপিএন নেটওয়ার্কে বটম-আপ, এবং কনভোল্যুশনাল লেয়ার ফিচার ম্যাপগুলিকে আপস্যাম্পলিং করার প্রক্রিয়াটি উপরের-ডাউন, যেমন চিত্র 3-এ দেখানো হয়েছে।

2.2। স্থানিক পিরামিডাল পুলিং স্ট্রাকচার

স্থানিক পিরামিড পুলিং (SPP) কাঠামো (20] কনভোল্যুশনাল নিউরাল নেটওয়ার্কগুলির দ্বারা চিত্র বৈশিষ্ট্যগুলির বারবার নিষ্কাশনের সমস্যার সমাধান করে এবং সনাক্তকরণের দক্ষতাকে ব্যাপকভাবে উন্নত করে; SPPNet নেটওয়ার্ক কাঠামো চিত্র 4 এ দেখানো হয়েছে।

improve cognitive function

ইনপুট ইমেজের রেজোলিউশন একটি সম্পূর্ণ সংযুক্ত স্তর সহ একটি নিউরাল নেটওয়ার্কে সম্পূর্ণ সংযুক্ত স্তরের বৈশিষ্ট্য মাত্রার সাথে মেলে তা নিশ্চিত করতে, ইনপুট চিত্রে অঞ্চল ক্রপিং এবং স্কেলিং অপারেশন প্রয়োজন।

স্কেলিং এবং ক্রপিং প্রক্রিয়ার ফলে ছবির বৈশিষ্ট্যের তথ্য নষ্ট হবে, সনাক্তকরণের নির্ভুলতা হ্রাস পাবে এবং সনাক্তকরণের ফলাফলগুলিকে প্রভাবিত করবে: তবে, স্কেলিং এবং ক্রপিং প্রক্রিয়ার ফলে ছবির বৈশিষ্ট্য তথ্য সনাক্তকরণের যথার্থতা নষ্ট হবে এবং সনাক্তকরণের ফলাফলগুলিকে প্রভাবিত করবে, যেখানে SPPNet সীমাবদ্ধতাগুলি অতিক্রম করতে পারে। ইনপুট ইমেজের নির্দিষ্ট আকার, কম্পিউটেশনাল খরচ বাঁচায় 21।

improve short term memory

3. উন্নত YOLOv3

3.1। উন্নত YOLOv3 নেটওয়ার্ক কাঠামো

COCO ডেটাসেট বর্ণনা অনুসারে মৌলিক বৈশিষ্ট্য নিষ্কাশন নেটওয়ার্কটি সাধারণত পাঁচ বার ডাউনস্যাম্পল করা হয়, যার আডাউনস্যাম্পলিং রেট 2 এবং পাঁচ গুণ ডাউনস্যাম্পলিং এর গুণিতক হল 32 থেকে দুইটির পঞ্চম শক্তি।

ডাউনস্যাম্পলিং অব্যাহত থাকলে, প্রাপ্ত বৈশিষ্ট্য মানচিত্র একটি হবে এবং লক্ষ্য তথ্য হারিয়ে যাবে। ছোট লক্ষ্যগুলি 32 × 32 পিক্সেলের কম, মাঝারি লক্ষ্যগুলি 32 × 32–96 × 96 পিক্সেল এবং দৈত্য লক্ষ্যগুলি 96 × 96 পিক্সেলের বেশি [22]।

চিত্র 5-এ যেমন দেখানো হয়েছে, এই কাজে ব্যবহৃত TT100K ট্র্যাফিক সাইন ডেটাসেটগুলি বেশিরভাগই ছোট এবং মাঝারি লক্ষ্যগুলির সমন্বয়ে গঠিত, মোট ডেটাসেটের মাত্র 7.4% এবং ক্ষুদ্র লক্ষ্যগুলির জন্য অ্যাকাউন্টিং 42.5% [23]।

increase memory

TT100K ডেটাসেটের একটি উচ্চ রেজোলিউশন রয়েছে, প্রতিটি ছবির রেজোলিউশন 2048 × 2048 পিক্সেল এবং ছোট লক্ষ্যগুলির মধ্যে সবচেয়ে বড় ট্র্যাফিক লক্ষণগুলি সমগ্র চিত্রের 0.1% এরও কম, লক্ষ্যের জন্য একটি উল্লেখযোগ্য চ্যালেঞ্জ তৈরি করে সনাক্তকরণ গরিদম

ছোট লক্ষ্যগুলির সীমিত বৈশিষ্ট্য রয়েছে এবং মহান স্থানীয়করণ নির্ভুলতার প্রয়োজন।

YOLOv3-এ FPN কাঠামোর প্রবর্তন হওয়া সত্ত্বেও স্বতন্ত্র বৈশিষ্ট্য স্তরগুলির ফলাফলগুলিকে একত্রিত করে ভবিষ্যদ্বাণী তৈরি করতে মাল্টি-স্কেল ফিচারফিউশনের সুবিধা নেওয়ার জন্য, যা ছোট লক্ষ্য সনাক্তকরণের জন্য গুরুত্বপূর্ণ, ফলাফলগুলি এখনও অসন্তুষ্ট ছিল।

YOLOv3 নেটওয়ার্কে, অগভীর স্তরটিতে কম বৈশিষ্ট্যযুক্ত শব্দার্থগত তথ্য থাকে তবে একটি সুনির্দিষ্ট লক্ষ্য অবস্থান থাকে, যেখানে গভীর স্তরে আরও বেশি কিন্তু একটি মোটা লক্ষ্য অবস্থান থাকে।

ফলস্বরূপ, অগভীর আবর্তিত স্তরগুলি ছোট লক্ষ্যগুলির পূর্বাভাস দিতে ব্যবহৃত হয় এবং গভীর আবর্তিত স্তরগুলি বড় লক্ষ্যগুলির পূর্বাভাস দিতে ব্যবহৃত হয়। YOLOv3network কাঠামোর তিনটি বৈশিষ্ট্য ভবিষ্যদ্বাণী স্কেলে 152 × 152 আকারের একটি চতুর্থ বৈশিষ্ট্য ভবিষ্যদ্বাণী স্কেল যোগ করা হয়েছে যাতে ক্ষুদ্র লক্ষ্যমাত্রাগুলির পূর্বাভাসের জন্য নেটওয়ার্কের অগভীর বৈশিষ্ট্যগুলি সম্পূর্ণরূপে ব্যবহার করা যায়।

ইনপুট ইমেজ সাইজ 608 × 608 সহ, আউটপুট ইমেজ ফিচার সাইজ ছিল 152 × 152 কনভল্যুশনের পরে এবং ইনপুট ইমেজের দ্বিগুণ আপস্যাম্পলিং, এবং ফিচারলেয়ারটি রাউটিং লেয়ারের মাধ্যমে প্ররোচিত হয়েছিল; চতুর্থ বৈশিষ্ট্য পূর্বাভাস স্কেল বাড়ানোর জন্য এই বৈশিষ্ট্য নিষ্কাশনটি 11 তম স্তর বৈশিষ্ট্যের সাথে মিশ্রিত করা হয়েছিল।

এছাড়াও, SPP মডিউলটি SPPNet-এর ধারণা ধার করে এবং YOLOv3 এর সাথে একত্রিত করে স্থানীয় এবং বৈশ্বিক বৈশিষ্ট্যগুলির একত্রীকরণ উপলব্ধি করার জন্য যুক্ত করা হয়েছিল।

YOLOdetection লেয়ারের আগে, SPP মডিউলটি পঞ্চম এবং ষষ্ঠ কনভোলিউশনাল লেয়ারের মধ্যে একীভূত করা হয়েছিল এবং SPP মডিউলের ফিচার ম্যাপ এবং ফিচার ম্যাপ পুল করা হয়েছিল এবং পরবর্তী ডিটেকশন নেটওয়ার্ক লেয়ারে পাঠানো হয়েছিল।

improve working memory

স্থানীয় এবং বৈশ্বিক বৈশিষ্ট্যগুলির বৈশিষ্ট্যম্যাপ স্তরের ফিউশন সম্পন্ন করার জন্য, SPP মডিউলের সর্বাধিক পুলিং কার্নেল যতটা সম্ভব বৈশিষ্ট্য মানচিত্রের আকারের কাছাকাছি হওয়া উচিত।

এসপিপি মডিউল দ্বারা সৃষ্ট কম্পিউটেশনাল প্রচেষ্টাকে কমিয়ে আনতে, বৈশিষ্ট্য মানচিত্র অভিব্যক্তি ক্ষমতাকে সমৃদ্ধ করতে এবং সনাক্তকরণ প্রভাব বাড়াতে, এই গবেষণায় এসপিপি মডিউলটি দুটি সমান্তরাল শাখার সমন্বয়ে গঠিত হয়েছিল, যার প্রতিটি 19 × 19 সর্বোচ্চ পুলিং লেয়ার এবং অ্যাজাম্প দ্বারা গঠিত ছিল। সংযোগ চিত্র 6 উন্নত YOLOv3 নেটওয়ার্ক কাঠামো চিত্রিত করে।

ways to improve brain function

3.2। উন্নত ক্ষতি ফাংশন

YOLOv3 এর লস ফাংশনটি কেন্দ্রের স্থানাঙ্ক ক্ষতি (ক্ষতিকর), প্রস্থ-উচ্চতা স্থানাঙ্ক ক্ষতি (ক্ষতি), আত্মবিশ্বাসের ক্ষতি (লসকনফ), এবং শ্রেণীবিভাগের ক্ষতি (ক্ষতি) দ্বারা গঠিত। কেন্দ্রীয় স্থানাঙ্ক ক্ষতি দ্বারা প্রতিনিধিত্ব করা হয়:

improve your memory

যেখানে λcoord বোঝায় স্থানাঙ্ক হ্রাস ওজন; λnoobj বোঝায় কোন বস্তু ছাড়াই ভরসা হারানো; Iobjij নির্দেশ করে যে ith ঘরের jth অ্যাঙ্কর বক্সটি বস্তুর জন্য দায়ী কিনা (1 বা 0); Inobbyij ith গ্রিডের jth অ্যাঙ্কর বক্সকে নির্দেশ করে যেটি বস্তুর জন্য দায়ী নয়; (xi,yi,wji,hjI, CjI, Pji) পূর্বাভাসিত টার্গেট বক্সের স্থানাঙ্ক, আত্মবিশ্বাস, এবং শ্রেণী বোঝায়; এবং (xˆji,yˆji,wji, ˆhjI, CˆjI, Pˆji) প্রকৃত টার্গেট বক্স স্থানাঙ্ক, আত্মবিশ্বাস এবং বিভাগ বোঝায়

YOLOv3 লস ফাংশনটি সমীকরণ (5) দ্বারা উপস্থাপিত হয়, যেখানে গড় স্কোয়ার এরর (MSE) ক্ষতি ফাংশনটি বাউন্ডিং বক্স রিগ্রেশনের জন্য ব্যবহৃত হয় এবং লসকনফ এবং স্থানীয়দের ক্ষতি ফাংশন হিসাবে ক্রস-এনট্রপি ব্যবহার করা হয়।

ক্ষতি=lossxy + losswh − losscon f − losscls (5)

যাইহোক, বাউন্ডিং বক্স রিগ্রেশনের ক্ষতি ফাংশন হিসাবে MSE ব্যবহার করা ছোট লক্ষ্য সনাক্তকরণের জন্য প্রতিকূল, অবজেক্ট স্কেলের প্রতি সংবেদনশীল, এবং ছোট আকারের বস্তুর প্রতি বন্ধুত্বহীন হওয়ার সময় বড়-স্কেল লক্ষ্যগুলিতে ফোকাস করে।

বড় এবং ছোট লক্ষ্যগুলির ক্ষতির ভারসাম্য বজায় রাখতে এবং প্রস্থ এবং উচ্চতা হ্রাস ফাংশনের উপর বাউন্ডিং বাক্সের আকারের প্রভাবকে দুর্বল করে সনাক্তকরণের ফলাফলগুলিকে সর্বাধিক করতে, এই কাগজে IoU- প্রকার ক্ষতি ফাংশন নিযুক্ত করা হয়েছিল, এবং IoU দ্বারা উত্পন্ন মেট্রিক ক্ষতি হিসাবে ব্যবহৃত হয়েছিল একটি কর্মক্ষমতা সমীকরণ (6)।

IoU =|A ∩ B||A ∪ B|(6)

যখন বাউন্ডিং বক্স এবং টার্গেট বক্স ওভারল্যাপ না হয়, তখন IoU=0 দুটি বাক্সের মধ্যে দূরত্বের ব্যবধান প্রতিফলিত করে না; যখন ভবিষ্যদ্বাণী বাক্স এবং লেবেলযুক্ত বাক্স সম্পূর্ণরূপে ওভারল্যাপ হয়, IoU=1, বাউন্ডিং বাক্সের কেন্দ্র বিন্দু নির্ধারণ করা যায় না, এবং লক্ষ্য বাক্সের সাথে আকারের ব্যবধান আরও অপ্টিমাইজ করা যায় না।

DIoU ক্ষতি [24] আকারের স্বাধীন; এইভাবে, বড় আকারের একটি বড় ক্ষতি হবে না. যেহেতু একটি ক্ষুদ্র আকার সামান্য ক্ষতি তৈরি করে, যা সমস্যার সমাধান করতে পারে, এই কাজটি DIoU ক্ষতি ব্যবহার করেছে, যার গণনার সূত্রটি সমীকরণ (7) এ উপস্থাপিত হয়েছে।

D IoU ক্ষতি=1 − IoU +ρ2 b, bgt c2(7)

যেখানে b এবং bgt কেন্দ্রীয় বিন্দুগুলি নির্দেশ করে, ρ হল ইউক্লিডীয় দূরত্ব, এবং c হল দুটি বাক্সকে আচ্ছাদিত ক্ষুদ্রতম ঘেরা বাক্সের তির্যক দৈর্ঘ্য।

DIoU ক্ষতি দুটি টার্গেট ফ্রেমের মধ্যে দূরত্বকে কম করে সরাসরি, দ্রুত একত্রিত হয় এবং টার্গেট ফ্রেম রিগ্রেশন মেকানিজমের সাথে আরও বেশি সামঞ্জস্যপূর্ণ, যা লক্ষ্য এবং অ্যাঙ্কর, ওভারল্যাপ রেট এবং স্কেলের মধ্যে দূরত্বকে বিবেচনা করে, লক্ষ্য ফ্রেমের রিগ্রেশনকে আরও বেশি করে তোলে। স্থিতিশীল, যখন এটি লক্ষ্য ফ্রেমের সাথে ওভারল্যাপ না করে তখনও বাউন্ডিং বক্সের জন্য গ্রেডিয়েন্ট দিক প্রদান করে।

help with memory


For more information:1950477648nn@gmail.com


তুমি এটাও পছন্দ করতে পারো