মেশিন লার্নিং অ্যালগরিদম ব্যবহার করে স্পিচ সিগন্যাল থেকে উন্নত ফিচার প্যারামিটার এক্সট্রাকশন(1)

May 30, 2023

বিমূর্ত: বক্তৃতা স্বীকৃতি বলতে সফ্টওয়্যার বা হার্ডওয়্যারের একটি স্পিচ সিগন্যাল পাওয়ার ক্ষমতা বোঝায়, স্পিচ সিগন্যালে স্পিকারের বৈশিষ্ট্যগুলি সনাক্ত করা এবং তারপরে স্পিকারকে চিনতে পারে৷ সাধারণভাবে, বক্তৃতা শনাক্তকরণ প্রক্রিয়ায় তিনটি প্রধান ধাপ জড়িত: শাব্দ প্রক্রিয়াকরণ, বৈশিষ্ট্য নিষ্কাশন এবং শ্রেণিবিন্যাস/স্বীকৃতি। বৈশিষ্ট্য নিষ্কাশনের উদ্দেশ্য হল পূর্বনির্ধারিত সংখ্যক সংকেত উপাদান ব্যবহার করে একটি বক্তৃতা সংকেত চিত্রিত করা। এর কারণ হল শাব্দ সংকেতের সমস্ত তথ্য পরিচালনা করা অত্যধিক কষ্টকর, এবং কিছু তথ্য সনাক্তকরণের কাজে অপ্রাসঙ্গিক। এই অধ্যয়নটি একটি মেশিন লার্নিং-ভিত্তিক পদ্ধতির প্রস্তাব করে যা রিয়েল-টাইম স্মার্ট সিটি পরিবেশে বক্তৃতা শনাক্তকরণ অ্যাপ্লিকেশনগুলির কর্মক্ষমতা উন্নত করতে স্পিচ সিগন্যাল থেকে বৈশিষ্ট্য প্যারামিটার নিষ্কাশন করে। অধিকন্তু, ক্যাশে মূল মেমরির একটি ব্লক ম্যাপ করার নীতিটি কম্পিউটিং সময় কমাতে দক্ষতার সাথে ব্যবহার করা হয়। ক্যাশে মেমরির ব্লক সাইজ হল একটি প্যারামিটার যা ক্যাশে কর্মক্ষমতাকে দৃঢ়ভাবে প্রভাবিত করে। বিশেষ করে, রিয়েল-টাইম সিস্টেমে এই জাতীয় প্রক্রিয়াগুলির বাস্তবায়নের জন্য একটি উচ্চ গণনা গতির প্রয়োজন। প্রক্রিয়াকরণ গতি রিয়েল-টাইম সিস্টেমে বক্তৃতা স্বীকৃতিতে একটি গুরুত্বপূর্ণ ভূমিকা পালন করে। এটির জন্য আধুনিক প্রযুক্তি এবং দ্রুত অ্যালগরিদমগুলির ব্যবহার প্রয়োজন যা বক্তৃতা সংকেত থেকে বৈশিষ্ট্যের পরামিতিগুলি বের করার ক্ষেত্রে ত্বরণ বাড়ায়। স্পিচ সিগন্যালের ডিজিটাল প্রক্রিয়াকরণের সময় ওভারক্লকিংয়ের সমস্যাগুলি এখনও পুরোপুরি সমাধান করা হয়নি। পরীক্ষামূলক ফলাফলগুলি দেখায় যে প্রস্তাবিত পদ্ধতিটি সফলভাবে সংকেত বৈশিষ্ট্যগুলি বের করে এবং অন্যান্য প্রচলিত বক্তৃতা স্বীকৃতি অ্যালগরিদমের তুলনায় বিরামহীন শ্রেণীবিভাগ কর্মক্ষমতা অর্জন করে।

Cistanche deserticola slice (11)

Cistanche deserticola

কীওয়ার্ড: কন্ঠ সনান্তকরণ; সমান্তরাল কম্পিউটিং; ডিস্ট্রিবিউটেড কম্পিউটিং; মাল্টিকোর প্রসেসর; বৈশিষ্ট্য নিষ্কাশন; বর্ণালী বিশ্লেষণ

1। পরিচিতি

আধুনিক কৃত্রিম বুদ্ধিমত্তায় মানুষ এবং কম্পিউটার প্রযুক্তির মধ্যে যোগাযোগের পদ্ধতির প্রতিষ্ঠা একটি গুরুত্বপূর্ণ কাজ। ব্যবহারকারীদের তথ্য প্রবেশের জন্য সবচেয়ে সহজ পদ্ধতিগুলির মধ্যে একটি হল বক্তৃতা সংকেতের মাধ্যমে। অতএব, বক্তৃতা সংকেত প্রক্রিয়াকরণ প্রযুক্তি এবং এর সরঞ্জামগুলি তথ্য সমাজের একটি প্রয়োজনীয় অংশ হয়ে উঠেছে। বক্তৃতা স্বীকৃতি হল বক্তৃতা সংকেত প্রক্রিয়াকরণের একটি অপরিহার্য গবেষণা দিক এবং একটি গুরুত্বপূর্ণ মানব-কম্পিউটার মিথস্ক্রিয়া কৌশল। বক্তৃতা সংকেত শব্দার্থিক, ব্যক্তিগত, এবং পরিবেশগত তথ্য ধারণ করে [1]। বক্তৃতা সংকেত প্রক্রিয়াকরণের সাধারণ পদ্ধতি হল স্বল্প-মেয়াদী বিশ্লেষণ ব্যবহার করা, যেখানে সংকেতকে একটি নির্দিষ্ট আকারের সময় উইন্ডোতে বিভক্ত করা হয়, ধরে নেওয়া হয় যে সংকেত পরামিতিগুলি পরিবর্তন হয় না। আরও সঠিক সংকেত উপস্থাপনা পেতে উইন্ডোগুলির মধ্যে একটি ওভারল্যাপ স্থাপন করা হয়। বৈশিষ্ট্য নিষ্কাশন অ্যালগরিদম যেমন বর্ণালী বিশ্লেষণ এবং রৈখিক পূর্বাভাস প্রতিটি উইন্ডোতে প্রয়োগ করা হয়। যাইহোক, এই প্রক্রিয়াগুলির গতি এবং সময়ও বিবেচনা করা উচিত।

Desert living cistanche

মরুভূমি জিনসেং

রিয়েল-টাইম সিগন্যাল প্রক্রিয়াকরণের বিভিন্ন ক্ষেত্রে সময় একটি উল্লেখযোগ্য উদ্বেগ। দক্ষতার সাথে প্রসেসর সংস্থান ব্যবহার করে এবং ডিজিটাল প্রক্রিয়াকরণের সময় কমাতে নতুন এবং দ্রুত অ্যালগরিদম তৈরি করে প্রক্রিয়াকরণের গতির অনুপাত বাড়ানো যেতে পারে। যাইহোক, উচ্চ-পারফরম্যান্স কম্পিউটিং সমস্যাগুলি এখনও সম্পূর্ণরূপে সমাধান করা হয়নি [2]। অধিকন্তু, ডিজিটাল সিগন্যাল প্রসেসিং হার্ডওয়্যার এবং সফ্টওয়্যার বিকাশের সাথে স্বয়ংক্রিয় বক্তৃতা স্বীকৃতিতে উল্লেখযোগ্য অগ্রগতি হয়েছে। যাইহোক, এই অগ্রগতি সত্ত্বেও, মেশিনগুলি সঠিকতা এবং গতির স্বীকৃতির ক্ষেত্রে, বিশেষ করে স্পিকার-স্বাধীন বক্তৃতা স্বীকৃতির ক্ষেত্রে তাদের মানব প্রতিপক্ষের কর্মক্ষমতার সাথে মেলে না। এইভাবে, বক্তৃতা শনাক্তকরণের উপর পরিচালিত একটি বিশাল পরিমাণ গবেষণা বক্তৃতা সনাক্তকরণের সমস্যাগুলির উপর দৃষ্টি নিবদ্ধ করেছে যা স্পিকার থেকে স্বতন্ত্র, অ্যাপ্লিকেশনের বিস্তৃত পরিসর এবং উপলব্ধ বক্তৃতা শনাক্তকরণ কৌশলগুলির সীমাবদ্ধতার কারণে [3]।

সংক্ষেপে, অধ্যয়নের প্রধান অবদানগুলি নিম্নরূপ:

cistanche tea

সিস্তানচে চা

Cistanche deserticola চা পণ্য দেখতে এখানে ক্লিক করুন

【আরো জন্য জিজ্ঞাসা করুন】 ইমেল:cindy.xue@wecistanche.com / Whats অ্যাপ: 0086 18599088692 / Wechat: 18599088692

বক্তৃতা সংকেত দ্বারা একজন ব্যক্তিকে সনাক্ত করার প্রক্রিয়াটি বিভিন্ন পর্যায়ে গঠিত। তাদের মধ্যে, কিছু পদক্ষেপের জন্য আরও গণনা সময় প্রয়োজন। এটি একটি বর্ণালী বিশ্লেষণ। মেশিন লার্নিং অ্যালগরিদমগুলিতে বিশেষভাবে গুরুত্বপূর্ণ প্যারামিটারগুলির মধ্যে একটি হল প্রশিক্ষণের সময়। এই কাজে, আমরা খুঁজে পেয়েছি যে বৈশিষ্ট্যগুলি বের করার প্রক্রিয়াটি বক্তৃতা সংকেত সনাক্তকরণের জন্য গুরুত্বপূর্ণ। উপরন্তু, মেশিন লার্নিংয়ে অনেক সময় লাগে। এটি প্রতিষ্ঠিত হয় যে বর্ণালী বিশ্লেষণের প্রক্রিয়াটি স্বাধীন ক্রিয়াকলাপ নিয়ে গঠিত এবং সমান্তরালকরণ সম্ভব।

পরীক্ষায় দেখা গেছে যে FFT এবং DCT বর্ণালী রূপান্তর বর্ণালী বিশ্লেষণে ভাল ফলাফল দেয়। বর্ণালী বিশ্লেষণ প্রক্রিয়াটি বক্তৃতা সংকেতের প্রতিটি অংশের জন্য বৈধ। এটি আমাদের স্পিচ সিগন্যাল থেকে এই বৈশিষ্ট্যগুলিকে স্পষ্টভাবে আলাদা করতে দেয়। OpenMP এবং TBB সরঞ্জামগুলির সাহায্যে, একটি সমান্তরাল কম্পিউটিং অ্যালগরিদম তৈরি করা হয়েছিল যা গণনার গতি বাড়ানো সম্ভব করেছিল।

একটি স্পিচ সিগন্যালকে সেগমেন্টে ভাগ করার সময় সেগমেন্টের আকার গুরুত্বপূর্ণ। পরীক্ষা চলাকালীন, এটি পাওয়া গেছে যে স্পিচ সিগন্যালের সেগমেন্টের আকার কেন্দ্রীয় প্রসেসরের ক্যাশে মেমরির উপর নির্ভর করে। বিশেষ করে, মাল্টিকোর প্রসেসরে ক্যাশের আকারের সাথে ম্যাচিং সেগমেন্ট মেশিন লার্নিংয়ে গণনাগত গতিতে ইতিবাচক প্রভাব ফেলেছে।

TBB এবং OpenMP ব্যবহার করে মাল্টিকোর প্রসেসরে মেশিন লার্নিং অ্যালগরিদম ব্যবহার করে স্পিচ সিগন্যাল থেকে ফিচার প্যারামিটার নিষ্কাশনের জন্য সিগন্যালের বর্ণালী রূপান্তরের জন্য একটি নতুন সমান্তরাল বাস্তবায়ন পদ্ধতি প্রস্তাব করা হয়েছে।

এটিও পাওয়া গেছে যে মূল মেমরি ব্লককে ক্যাশে ম্যাপ করার নীতির কার্যকর ব্যবহার এবং ক্যাশে মেমরি ব্লকের আকার প্রক্রিয়াকরণের গতি বাড়াতে পারে।

Cistanche supplement near me—Improve memory2

আমার কাছাকাছি Cistanche সম্পূরক-উন্নতি মেমরি

এই কাগজের অবশিষ্টাংশ নিম্নরূপ সংগঠিত হয়. বিভাগ 2 নির্দিষ্ট বক্তৃতা সংকেত বৈশিষ্ট্য নিষ্কাশন জন্য বিদ্যমান গবেষণা পর্যালোচনা. বিভাগ 3 পরীক্ষা সহ বৈশিষ্ট্য নিষ্কাশন পদক্ষেপ বর্ণনা করে। বিভাগ 4 বিশদভাবে বক্তৃতা সংকেত থেকে বৈশিষ্ট্য পরামিতি নিষ্কাশনের জন্য প্রস্তাবিত উচ্চ-কর্মক্ষমতা গণনামূলক অ্যালগরিদম উপস্থাপন করে। আমাদের বাস্তবায়নের উপর ভিত্তি করে পরীক্ষামূলক ফলাফলগুলি অধ্যায় 5 এ আলোচনা করা হয়েছে৷ বিভাগ 6 প্রস্তাবিত পদ্ধতির সীমাবদ্ধতাগুলিকে হাইলাইট করে৷ পরিশেষে, বিভাগ 7 ফলাফলের সংক্ষিপ্তসার এবং ভবিষ্যতের গবেষণার দিকনির্দেশনা উল্লেখ করে অধ্যয়নটি শেষ করে।

2. সম্পর্কিত কাজ

অভিনব পদ্ধতি, অ্যালগরিদম এবং আরও আধুনিক অ্যাপ্লিকেশন বর্তমানে বক্তৃতা সংকেতগুলির বিভাজন এবং নির্বাচিত খণ্ডগুলির প্যারামেট্রিক সূচকগুলির গণনার জন্য উন্নত এবং উন্নত করা হচ্ছে, যার ফলে বর্ণালী বিশ্লেষণ [4-7] ব্যবহার করে বক্তৃতা সংকেতের একটি বর্ণালী তৈরি করা হচ্ছে। বিশ্বজুড়ে বৈচিত্র্যময় ভয়েস ক্লিপগুলির সাথে স্পিকার সনাক্তকরণ একটি গুরুত্বপূর্ণ এবং চ্যালেঞ্জিং কাজ, বিশেষ করে জোরালো এবং বৈষম্যমূলক বৈশিষ্ট্যগুলি আহরণের ক্ষেত্রে [৮]। একটি উপন্যাস Mel Frequency Cepstral Coefficients (MFCC) বৈশিষ্ট্য নিষ্কাশন ব্যবস্থা যা প্রচলিত MFCC উপলব্ধির চেয়ে দ্রুত এবং আরও বেশি শক্তি সাশ্রয়ী, কোর্কমাজ এট আল দ্বারা প্রস্তাবিত হয়েছিল। [9]। একটি উচ্চ-পাস প্রাক-জোর প্রদানকারী ফিল্টার ব্যবহার করার পরিবর্তে, তারা একটি নিম্ন-পাস ফিল্টার ব্যবহার করেছিল। তারা একটি উচ্চ-পাস ফিল্টার সহ একটি ব্যান্ডপাস ফিল্টার প্রয়োগ করেছে কারণ উচ্চ ফ্রিকোয়েন্সিতে সিগন্যালের শক্তি বাড়ানোর জন্য প্রাক জোর দেওয়া প্রয়োজন। আমাদের পূর্ববর্তী কাজ [10] এ, আমরা স্পিকার সনাক্তকরণের জন্য একটি অভিনব MFCC-ভিত্তিক পদ্ধতি উপস্থাপন করেছি। প্রচলিত MFCC ব্যবহার করার পরিবর্তে, আমরা আমাদের বৈশিষ্ট্য সেট হিসাবে Mel স্পেকট্রোগ্রাম থেকে পিক্সেল নিযুক্ত করি। একটি নতুন ডেটাসেট তৈরি করতে স্পেকট্রোগ্রামটিকে একটি 2-D অ্যারেতে রূপান্তরিত করা হয়েছিল৷ স্পিকারকে শনাক্ত করার জন্য, একটি 10-ফোল্ড ক্রস-ভ্যালিডেশন টেকনিকের সাহায্যে বেশ কিছু শেখার অ্যালগরিদম ব্যবহার করা হয়েছিল। ট্যানহ অ্যাক্টিভেশন ফাংশন সহ একটি মাল্টি-লেয়ার পারসেপ্ট্রন (এমএলপি) এর সাহায্যে, 90.2 শতাংশের সর্বোত্তম নির্ভুলতা অর্জন করা হয়েছিল।

বৈশিষ্ট্য নিষ্কাশন পরবর্তী প্রক্রিয়াকরণ এবং বিশ্লেষণ [11-14] জন্য তুলনামূলকভাবে কম ডেটা হারে প্যারামেট্রিক উপস্থাপনা একটি ফর্ম বক্তৃতা তরঙ্গরূপ পরিবর্তন করে সম্পন্ন করা হয়. বৈশিষ্ট্য নিষ্কাশন পদ্ধতি সাধারণত প্রতিটি বক্তৃতা সংকেতের জন্য একটি বহুমাত্রিক বৈশিষ্ট্য ভেক্টর প্রদান করে। বৈশিষ্ট্য নিষ্কাশন হল স্পিকার স্বীকৃতির সবচেয়ে প্রাসঙ্গিক অংশ। অন্যদের থেকে একজন বক্তাকে আলাদা করার ক্ষেত্রে বক্তৃতার বৈশিষ্ট্যগুলির একটি গুরুত্বপূর্ণ অংশ রয়েছে। বৈশিষ্ট্য নিষ্কাশন বক্তৃতা সংকেতের মাত্রা হ্রাস করে, বক্তৃতা সংকেতের শক্তির কোন ক্ষতি না করে [15-17]। [১৮] সালে, লেখকরা একটি নতুন পদ্ধতির প্রবর্তন করেছেন যা একটি স্পিকার-নির্ভর স্বয়ংক্রিয় বক্তৃতা স্বীকৃতির কর্মক্ষমতা উন্নত করতে প্রাথমিক স্বল্প সময়ের ফুরিয়ার রূপান্তর গণনা করতে ব্যবহৃত বর্ণালী বিশ্লেষণ উইন্ডোর আকার এবং স্থানান্তর পরামিতিগুলির সূক্ষ্ম-টিউনিংকে কাজে লাগায়। (ASR) সিস্টেম। ডাক্তারের অনুপস্থিতিতে, সাধারণ মানুষ কৃত্রিম বুদ্ধিমত্তা পদ্ধতি ব্যবহার করে তৈরি করা সিদ্ধান্ত সহায়তা ব্যবস্থা নিয়োগ করতে পারে। ফোনোকার্ডিওগ্রাম (PCG) সংকেত [19-21] ব্যবহার করে প্রাথমিক এবং অ-আক্রমণকারী হার্টের অবস্থা সনাক্তকরণ সম্পন্ন করা যেতে পারে।

কনভোল্যুশনাল নিউরাল নেটওয়ার্ক (CNNs) ফিচার স্পেসে স্ট্রাকচারাল লোকেলিটি সফলভাবে সিমুলেট করার পাশাপাশি অনুবাদের ভিন্নতা কমাতে এবং ফিচার স্পেসে ব্যাঘাত ও ছোট পরিবর্তনের জন্য সামঞ্জস্য করার জন্য একটি পক্ষপাতদুষ্ট ফ্রিকোয়েন্সি অঞ্চলের মধ্যে পুলিং নিযুক্ত করার জন্য প্রদর্শিত হয়েছে [22]। মুখমদিয়েভ এট আল। উজবেক ভাষা এবং এর উপভাষার জন্য একটি এন্ড-টু-এন্ড ডিপ নিউরাল নেটওয়ার্ক-লুকানো মার্কভ মডেল স্পিচ রিকগনিশন মডেল এবং একটি হাইব্রিড কানেকশনিস্ট টেম্পোরাল ক্লাসিফিকেশন (CTC)-অ্যাটেনশন নেটওয়ার্ক প্রস্তাব করেছে। প্রস্তাবিত পদ্ধতিটি প্রশিক্ষণের সময় হ্রাস করে এবং মনোযোগ মডেল প্রশিক্ষণে কার্যকরভাবে CTC অবজেক্টিভ ফাংশন ব্যবহার করে বক্তৃতা সনাক্তকরণের নির্ভুলতা উন্নত করে [23]। একটি এক-মাত্রিক কনভোল্যুশনাল নিউরাল নেটওয়ার্ক (সিএনএন) মডেল ব্যবহার করে বৈশিষ্ট্য নিষ্কাশন এবং শ্রেণিবিন্যাস, যা হৃৎপিণ্ডের শব্দ সংকেতকে স্বাভাবিক এবং অস্বাভাবিকভাবে বিভক্ত করে সরাসরি ইলেক্ট্রোকার্ডিওগ্রাম (ইসিজি) থেকে স্বাধীন, [২৪] এ প্রস্তাব করা হয়েছিল। তারা দাবি করে যে এই গবেষণায় ব্যবহৃত হার্ট সাউন্ড সিগন্যালের জন্য 2D CNN-এর তুলনায় 1D CNN-এ শ্রেণিবিন্যাস নির্ভুলতা বেশি, যখন কনভোলিউশন কার্নেল 52-এর কম হয় কারণ একটি বড় কনভোলিউশন কার্নেল গণনাগত জটিলতার দিকে নিয়ে যেতে পারে এবং ক্রমবর্ধমান সময়সাপেক্ষ। . [25], টিআইএমআইটি ডাটাবেস (টিআইএমআইটি অ্যাকোস্টিক-ফোনেটিক কন্টিনিউয়াস স্পিচ কর্পাস) ব্যবহার করে বক্তৃতা বৈশিষ্ট্যের ক্রম সম্পর্কিত শাব্দ মডেলগুলির রাষ্ট্রীয় ক্রমগুলির উত্তরোত্তর নির্ভুলতা সর্বাধিক করার জন্য একটি গভীর নিউরাল নেটওয়ার্ককে প্রশিক্ষণ দেওয়া হয়েছিল।

3. প্রাক-প্রক্রিয়াকরণ: উপাদান ওভারভিউ

cistanche—Improve memory4

আমার কাছাকাছি Cistanche সম্পূরক-উন্নতি মেমরি

এই উদ্দেশ্যে, বক্তৃতা সংকেত এবং প্যারামেট্রিক উপস্থাপনা থেকে বৈশিষ্ট্য পরামিতি নিষ্কাশনের জন্য দ্রুত অ্যালগরিদমগুলির বিকাশ, প্রক্রিয়াকরণের জন্য সহায়ক এবং তথ্যপূর্ণ নমুনাগুলি নিষ্কাশন করা এবং নির্বাচিত শাব্দ বিভাগের বর্ণালীগ্রামগুলি বাস্তবায়নের জন্য প্রোগ্রামগুলির বিকাশ অপরিহার্য।

বক্তৃতা শনাক্তকরণ সিস্টেম দুটি প্রধান সাবসিস্টেম নিয়ে গঠিত:

বক্তৃতা সংকেতগুলির প্রাথমিক প্রক্রিয়াকরণ (ফোনোগ্রাম);

একটি বুদ্ধিমান অ্যালগরিদম (স্পেকট্রোগ্রাম) ব্যবহার করে শাব্দ প্রতীকের শ্রেণীবিভাগ।

প্রথম সাবসিস্টেমটি সংকেত এবং সংকেত বৈশিষ্ট্যের তথ্যমূলক শাব্দ বৈশিষ্ট্যের একটি সেট হিসাবে শাব্দ প্রতীক তৈরি করে। দ্বিতীয় সাবসিস্টেম প্রাপ্ত শাব্দ বৈশিষ্ট্যের উপর ভিত্তি করে বক্তৃতা সংকেতকে প্যারামেট্রিক ফর্মে রূপান্তর করে। স্পিচ সিগন্যাল প্রসেসিং নিম্নলিখিত ধাপগুলি নিয়ে গঠিত:

বক্তৃতা সংকেতের সীমানা বিচ্ছেদ;

ডিজিটাল ফিল্টারিং;

বিভাজন;

একটি মসৃণ উইন্ডোর আবেদন;

বর্ণালী রূপান্তর, এবং বর্ণালী ফ্রিকোয়েন্সি স্বাভাবিককরণ।

এই পদক্ষেপগুলি বক্তৃতা সংকেতগুলি থেকে বৈশিষ্ট্যের পরামিতিগুলি বের করতে ব্যাপকভাবে ব্যবহৃত হয় এবং তাদের প্রধান বৈশিষ্ট্যগুলি নিম্নলিখিতগুলিতে বিবেচনা করা হয়।

3.1। সীমানা বিচ্ছেদ

ইনকামিং সিগন্যাল থেকে শুধুমাত্র বক্তৃতার কিছু অংশ বের করা বা একটি শব্দের শুরু এবং শেষের মুহূর্তগুলি একটি কোলাহলপূর্ণ পরিবেশে নির্ধারণ করা বক্তৃতা প্রক্রিয়াকরণের একটি অপরিহার্য কাজ। এই সমস্যা সমাধানের জন্য বক্তৃতা সংকেতের নিম্নলিখিত বৈশিষ্ট্যগুলি ব্যবহার করা হয়: বক্তৃতা সংকেতের স্বল্প-মেয়াদী শক্তি, শূন্যে ছেদ করা বিন্দুর সংখ্যা, সংকেতের মধ্যে নীরবতার ক্ষেত্রের মানগুলির বিতরণের ঘনত্ব এবং বর্ণালী এনট্রপি। প্রথাগত বক্তৃতা শনাক্তকরণ সিস্টেম কৌশলগুলি ব্যবহার করে যা একটি সংকেতের ক্ষণস্থায়ী এবং বর্ণালী শক্তির উপর ভিত্তি করে (যেমন, ভয়েস কার্যকলাপ সনাক্তকরণ) আগত বক্তৃতা সংকেত [26-28] থেকে বক্তৃতা সীমানা নির্ধারণ করতে।

বক্তৃতা সংকেতের প্রধান পরামিতি হল বক্তৃতা সংকেতের স্বল্প-মেয়াদী শক্তি এবং শূন্যের মধ্য দিয়ে যাওয়া পয়েন্টের সংখ্যা। একটি নিয়ম হিসাবে, সময়ের সাথে সাথে একটি বক্তৃতা সংকেতের পরামিতিগুলি দ্রুত পরিবর্তন হয়; সুতরাং, একটি স্পিচ সিগন্যালকে 10 থেকে 30 ms দৈর্ঘ্যের টুকরো টুকরো করে প্রক্রিয়া করা প্রথাগত যা ওভারল্যাপ হয় না। বক্তৃতা সংকেত এই সীমার মধ্যে স্থির থাকে, এবং বক্তৃতা সংকেতের নীরবতার ক্ষেত্রগুলি ক্ষণস্থায়ী শক্তি গণনা করে সরানো হয়। এই সমস্যাটি সমাধানের জন্য অ্যালগরিদমটি পরবর্তী বক্তৃতা সংকেতের 256 স্বল্প-মেয়াদী শক্তি মানগুলির N ক্রমগুলিতে বিভক্ত।

বক্তৃতা সংকেতকে ভাগ করে প্রতিটি খণ্ডের শক্তির গণনা সমান্তরাল এবং বিতরণ করা কম্পিউটিংয়ের জন্য উপযুক্ত। প্রতিটি খণ্ড স্বাধীনভাবে প্রক্রিয়া করা হয়. যদি একটি এন-কোর মাল্টিপ্রসেসরে প্রক্রিয়াকরণ প্রয়োগ করা হয়, তাহলে একই সাথে n খণ্ডের শক্তি গণনা করা সম্ভব হবে। অতএব, এই পর্যায়ে [২৯-৩২] সমান্তরাল প্রক্রিয়াকরণের দক্ষতা বৃদ্ধি করা সম্ভব।

3.2। জিরো-ক্রসিং সংখ্যা

একটি শূন্য-ক্রসিং হল এমন একটি বিন্দু যেখানে একটি গাণিতিক ফাংশনের চিহ্ন পরিবর্তিত হয় (যেমন, ধনাত্মক থেকে ঋণাত্মক), যা ফাংশনের গ্রাফে অক্ষের একটি বাধা (শূন্য মান) দ্বারা প্রতিনিধিত্ব করা হয় [33]। একটি সিগন্যালে জিরো-ক্রসিং ফ্রিকোয়েন্সি তার বর্ণালী বৈশিষ্ট্যগুলির সবচেয়ে সহজবোধ্য সূচক হতে পারে। উদাহরণস্বরূপ, একটি বক্তৃতা সংকেতে শূন্যের মধ্য দিয়ে যাওয়া পয়েন্টের সংখ্যা নিম্নলিখিত সমীকরণ ব্যবহার করে নির্ধারণ করা যেতে পারে:

Figure 1. Method of speech separation based on spectral entropy analysis.


চিত্র 1. বর্ণালী এনট্রপি বিশ্লেষণের উপর ভিত্তি করে বক্তৃতা পৃথকীকরণের পদ্ধতি।

3.3। ডিজিটাল ফিল্টারিং

একটি সাধারণ, দরকারী সংকেত ছাড়াও, বিভিন্ন ধরনের শব্দ উপস্থিত থাকে। যেহেতু শব্দটি বক্তৃতা শনাক্তকরণ সিস্টেমের গুণমানকে নেতিবাচকভাবে প্রভাবিত করে, তাই শব্দের সাথে মোকাবিলা করা একটি গুরুত্বপূর্ণ বিষয়। সিস্টেমে শব্দের মাত্রা কমাতে দুই ধরনের ডিজিটাল ফিল্টার ব্যবহার করা হয়: একটি লাইন ফিল্টার এবং একটি প্রাথমিক ফিল্টার। একটি রৈখিক ফিল্টারকে নিম্ন- এবং উচ্চ-ফ্রিকোয়েন্সি ফিল্টারের সংমিশ্রণ হিসাবে বিবেচনা করা যেতে পারে কারণ এটি সমস্ত কম এবং উচ্চ ফ্রিকোয়েন্সি ক্যাপচার করে। প্রাথমিক ফিল্টারিং পরবর্তী শনাক্তকরণের জন্য ব্যবহৃত বৈশিষ্ট্যযুক্ত চিহ্নগুলিতে স্থানীয় ব্যাঘাতের প্রভাব কমানোর জন্য প্রয়োগ করা হয়। একটি বক্তৃতা সংকেত অবশ্যই বর্ণালী প্রান্তিককরণের জন্য একটি লো-পাস ফিল্টারের মধ্য দিয়ে যেতে হবে [35]।

3.4। সেগমেন্টেশন

বিভাজন হল একটি স্পিচ সিগন্যালকে বিচ্ছিন্ন, অ-ওভারল্যাপিং খন্ডে বিভক্ত করার প্রক্রিয়া। সংকেতকে সাধারণত বক্তৃতা ইউনিটে ভাগ করা হয় যেমন বাক্য, শব্দ, সিলেবল, ধ্বনি, বা এমনকি ছোট ধ্বনিগত ইউনিট। রেকর্ডিং এর বিভাজন যাতে অসংখ্য স্পিকারের উচ্চারণ থাকে তাতে নির্দিষ্ট স্পিকারদের উচ্চারণের অংশগুলিকে বৈশিষ্ট্যযুক্ত করা থাকতে পারে। "সেগমেন্ট স্টেশন" শব্দটি কখনও কখনও এটির প্যারামিটারাইজেশনের আগে স্পিচ সিগন্যালের ফ্রেমে বিভাজন করার জন্য ব্যবহৃত হয় [36,37]।

3.5। বর্ণালী রূপান্তর

বক্তৃতা শনাক্তকরণ প্রক্রিয়ার পরবর্তী পর্যায়ে ব্যবহৃত বক্তৃতা সংকেতের প্রধান বৈশিষ্ট্যগুলিকে আলাদা করা প্রয়োজন। প্রাথমিক বৈশিষ্ট্যগুলি বক্তৃতা সংকেতগুলির বর্ণালী বৈশিষ্ট্যগুলি বিশ্লেষণ করে নির্ধারিত হয়। দ্রুত ফুরিয়ার ট্রান্সফর্ম অ্যালগরিদম সাধারণত একটি বক্তৃতা সংকেতের বর্ণালী ফ্রিকোয়েন্সি পেতে ব্যবহৃত হয় [38,39]।

3.6। বর্ণালী ফ্রিকোয়েন্সি স্বাভাবিককরণ

বুদ্ধিমান অ্যালগরিদমের সম্পূর্ণ গণনা প্রক্রিয়াটি চলমান দশমিক সংখ্যার উপর ভিত্তি করে। অতএব, নিউরাল নেটওয়ার্ক ব্যবহার করে শ্রেণীবদ্ধ করা বস্তুর পরামিতি [{{0}} পরিসরে সীমাবদ্ধ।{3}}, 10]। নিউরাল নেটওয়ার্ক ব্যবহার করে বর্ণালী প্রক্রিয়াকরণ প্রয়োগ করার জন্য 0 এবং 1-এর মধ্যে ফলস্বরূপ বর্ণালীকে স্বাভাবিক করা হয়। এটি অর্জনের জন্য, প্রতিটি ভেক্টর উপাদানকে তার সর্বাধিক উপাদানগুলিতে ভাগ করা হয়।

বর্ণালী প্রক্রিয়াকরণ পদ্ধতিগুলি বক্তৃতা সংকেত থেকে প্রাপ্ত সমস্ত ডেটা নমুনার ব্যবহার সক্ষম করে। অনেক বক্তৃতা সংকেত একটি নির্দিষ্ট ফ্রিকোয়েন্সি গঠন এবং বর্ণালী বৈশিষ্ট্য আছে. বর্ণালী পদ্ধতিগুলি বক্তৃতা সংকেতের উচ্চ-নির্ভুল প্রক্রিয়াকরণ প্রদান করে। বর্ণালী প্রক্রিয়াকরণের অসুবিধাগুলির মধ্যে রয়েছে সংকেতের স্থানীয় বৈশিষ্ট্যে কম নমনীয়তা, বর্ণালী মাত্রার অভাব এবং তুলনামূলকভাবে উচ্চ গণনামূলক খরচ।

ফুরিয়ার ট্রান্সফরমেশন, ওয়েভলেট অ্যানালাইসিস এবং অন্যান্য অনেক অ্যালগরিদম স্পিচ সিগন্যালের বর্ণালী প্রক্রিয়াকরণে ব্যাপকভাবে ব্যবহৃত হয়। বক্তৃতা প্রক্রিয়াকরণ সহ বিজ্ঞানের অনেক ক্ষেত্রে ফুরিয়ার রূপান্তর ব্যবহার করা হয়। স্পিচ সিগন্যাল প্রসেসিং-এ, ফুরিয়ার ট্রান্সফরমেশন ফ্রিকোয়েন্সি উপাদান হিসেবে টাইম ফিল্ড থেকে স্পেকট্রাল ফিল্ডে সিগন্যালকে রূপান্তর করে [৪০]।

পূর্ববর্তী গবেষণায়, বর্ণালী বিশ্লেষণের জন্য বিচ্ছিন্ন ফুরিয়ার ট্রান্সফর্ম (ডিএফটি), বিচ্ছিন্ন কোসাইন ট্রান্সফর্ম (ডিসিটি), স্বল্পমেয়াদী ফুরিয়ার ট্রান্সফর্ম এবং ওয়েভলেট ট্রান্সফর্ম প্রয়োগ করা হয়েছিল। এই পদ্ধতিগুলি একটি স্পিচ সিগন্যালের টুকরোগুলিকে ফ্রিকোয়েন্সি ডোমেনে রূপান্তর করতে এবং বর্ণালী গণনা করতে ব্যবহৃত হয়েছিল। TBB এবং OpenMP প্যাকেজগুলি বর্ণালী রূপান্তরের জন্য সমান্তরাল অ্যালগরিদম তৈরি করতে ব্যবহৃত হয়েছিল। এই পদ্ধতিতে, কমান্ড সিগন্যালকে ফ্রেমে ভাগ করে; উদাহরণস্বরূপ, প্রতিটি ফ্রেমের জন্য N=16, 32, …, বা 4096 [4]। প্রতিটি তৈরি ফ্রেমের আকার ক্যাশে মেমরির ব্লক আকারের সমান কারণ ক্যাশে মেমরি একটি ফ্যাক্টর যা সমান্তরাল প্রক্রিয়াকরণের দক্ষতাকে প্রভাবিত করে। ত্বরণ ফলাফল চিত্র 2 এ চিত্রিত করা হয়েছে।

Figure 2. Acceleration results for (a) four- and (b) eight-core processors.


চিত্র 2. (a) চার- এবং (b) আট-কোর প্রসেসরের জন্য ত্বরণ ফলাফল।

সমান্তরাল প্রক্রিয়াকরণ অ্যালগরিদমগুলির সফ্টওয়্যার বাস্তবায়নের জন্য, চার- এবং আট-কোর প্রসেসরগুলিতে সিরিয়াল এবং সমান্তরাল প্রক্রিয়াকরণ করা হয়েছিল, যা ব্যক্তিগত কম্পিউটার এবং সার্ভার ব্যবহার করে প্রয়োগ করা হয়েছিল, সারণি 1 এ তালিকাভুক্ত।

সারণী 1. ইন্টেল প্রসেসরের বৈশিষ্ট্য।

Table 1. Characteristics of Intel processors.

ডিসিটি অ্যালগরিদমের প্রধান বৈশিষ্ট্য হল পর্যায়ক্রমিকতা। ডিসিটির একটি সুবিধা হল যে এটি বেশিরভাগ সংকেত শক্তিকে অল্প সংখ্যক কারণের উপর কেন্দ্রীভূত করে। নিম্নলিখিত সমীকরণগুলি সহগ ম্যাট্রিক্সের উপাদানগুলি প্রদান করে:

imageimage


যেখানে L(k) হল DCT-এর মান, k হল সহগগুলির একটি সূচক, x(n) ডেটা আইটেমগুলিকে প্রতিনিধিত্ব করে এবং N হল ফ্রেমের আকার৷

বর্ণালী ডোমেনের মধ্যে বক্তৃতা সংকেতগুলির ডিজিটাল প্রক্রিয়াকরণে বেশিরভাগ স্পিচ রিকগনিশন সিস্টেমে বৈশিষ্ট্য ভেক্টর তৈরি করতে ব্যবহৃত পদ্ধতিগুলির ভিত্তি হল ফুরিয়ার বিশ্লেষণ পরামিতি। মেল-ফ্রিকোয়েন্সি সেপস্ট্রাল সহগ (MFCCs) [41] এবং লিনিয়ার প্রেডিকটিভ কোডিং (LPC) কৌশল [42,43] স্পিচ সিগন্যাল থেকে স্পেকট্রোগ্রাম ইমেজ তৈরি করতে ফুরিয়ার বিশ্লেষণে ব্যবহৃত হয়। ফুরিয়ার বিশ্লেষণ ব্যবহার করে প্রাপ্ত বর্ণালী একটি বক্তৃতা সংকেত সম্পর্কিত সংক্ষিপ্ত এবং সুনির্দিষ্ট তথ্য প্রদান করে, যেমন চিত্র 3-এ দেখানো হয়েছে।

Figure 3. DFT: (a) change in frequency range within time domain and (b) spectrogram.


চিত্র 3. ডিএফটি: (ক) সময়ের ডোমেনের মধ্যে ফ্রিকোয়েন্সি পরিসরে পরিবর্তন এবং (খ) স্পেকট্রোগ্রাম।

পরীক্ষায় বর্ণালী বিশ্লেষণের জন্য দ্বি-মাত্রিক (2D) সংকেত ব্যবহার করা হয়েছিল। সমান্তরাল ইমেজ-প্রসেসিং অ্যালগরিদমগুলিতে ব্যবহৃত 2D বর্ণালী বিশ্লেষণ বৈশিষ্ট্যগুলি মাল্টিকোর প্রসেসরগুলিতে সমান্তরাল প্রক্রিয়াকরণের জন্য উপযুক্ত [38]। বিশেষ করে, ফরোয়ার্ড এবং ইনভারস ট্রান্সফরমেশন ভেক্টর এবং ম্যাট্রিক্সের বাইনারি মাত্রা রয়েছে এবং এই মাল্টিকোর প্রসেসর আর্কিটেকচারের সামঞ্জস্যতা গণনাগত গতিকে কার্যকরভাবে বাড়াতে পারে। অতএব, আমরা 2D সংকেত প্রক্রিয়াকরণের জন্য ব্যবহৃত অ্যালগরিদমগুলির হার্ডওয়্যার বাস্তবায়নের জন্য বিভিন্ন প্রসেসর বৈশিষ্ট্য সহ একটি কম্পিউটারে অনুক্রমিক এবং সমান্তরাল প্রক্রিয়াকরণ প্রয়োগ করেছি (সারণী 2)

সারণি 2. ইন্টেল প্রসেসর প্রয়োগের বৈশিষ্ট্য।

Table 2. Characteristics of applying Intel processors.


সমগ্র 2D সংকেত প্রতিটি পর্যায়ে বিভিন্ন আকারের অভিন্ন খণ্ডে বিভক্ত ছিল [44]। নির্বাচিত খণ্ডগুলির মানগুলি 16 × 16 এবং 1024 × 1024 এর পিক্সেল রেজোলিউশনের মধ্যে ছিল। অনুক্রমিক অ্যালগরিদমের তুলনায় OpenMP প্যাকেজ ব্যবহার করে সমান্তরাল DCT অ্যালগরিদমের গতি চিত্র 4 এ উপস্থাপিত হয়েছে একটি সমান্তরাল 2D বর্ণালী বিশ্লেষণের ব্যবহার মাল্টিকোর প্রসেসরের অ্যালগরিদম একটি ওভারক্লকিং ফলাফল দেয় যা কোরের সংখ্যার কাছাকাছি।

Figure 4. Acceleration results for 2D parallel spectral analysis.

চিত্র 4. 2D সমান্তরাল বর্ণালী বিশ্লেষণের জন্য ত্বরণ ফলাফল।

তুমি এটাও পছন্দ করতে পারো