حاليا فارغة: 0,00 EGP
وضع الصوت المتقدم في ChatGPT.. قفزة نوعية في التفاعل بين الإنسان والذكاء الاصطناعي

وضع الصوت المتقدم (Advanced Voice Mode – AVM) في ChatGPT يعتبره بعضهم قفزة نوعية في تقنيات التفاعل بين الإنسان والذكاء الاصطناعي، إذ بإمكانه أن ينقل المحادثة من مجرد تحويل النص إلى صوت لتجربة تفاعلية طبيعية، كأنك تتحدث مع شخص حقيقي وتقيم معه حوارًا متسلسلًا.
آلية العمل: المعالجة الصوتية المباشرة (Audio-to-Audio)
عادة ما كان التفاعلي في النماذج الصوتية التقليدية، يمر بـ 3 خطوات رئيسية، الأولى هي تحويل صوت المستخدم إلى نص، أو ما يعر ف بـ(Speech-to-Text)، والثانية معالجة النص عن طريق نماذج اللغة الكبيرة (LLM)، أما المرحلة الثالثة فهي تحويل إجابة النموذج النصية إلى صوت (Text-to-Speech)، لكن هذا الأسلوب غالبًا ما كان ينتج عنه، ومن خلال تجربتي الشخصية، تأخير ملحوظ (Latency)، مع فقدان كامل للنبرة والعواطف، أمّا في النموذج الجديد الذي طرحته أوبن إيه آي المالكة لتشات جي بي تي Advanced Voice Mode، فإنه يعتمد على نموذج أحادي natively multimodal مثل GPT-4o، يتعامل مع الإشارات الصوتية الداخلة والخارجة مباشرة دون الحاجة إلى وصلة نصية وسيطة.
الميزات الأساسية والقدرات التفاعلية
ومن الميزات الأساسية التي يتمتع بها النموذج الجديد، والتي اختبرناها شخصيا:
| الميزة | الوصف التقني والاستخدام |
| استجابة شبه فورية | معدل تأخير منخفض جدًا يصل إلى ~320 ميلي ثانية، ما يعادل زَمَن استجابة الإنسان في المحادثات العادية. |
| فهم النبرة والمشاعر | القدرة على التقاط الإشارات الصوتية غير اللفظية كسرعة الحديث والهمس والسخرية والانفعال والتجاوب معها بالنبرة نفسها. |
| المقاطعة الطبيعية (Natural Interruptions) | إمكانية التحدث ومقاطعة النموذج في منتصف الجملة، ومن ثم يتوقف فورًا ويتكيّف ببراعة مع التوجيه الجديد للمستخدم دون أي ارتباك، أو فقدان سياق الحديث. |
| التحكم في الأسلوب والتعبيرات | توجيه النموذج ليتحدث بلهجة معينة، أو إيقاع سريع/بطيء، أو تمثيل شخصيات محددة في أثناء سرد القصص. |
نموذج تشات جي بي تي الجديد يعتمد على نموذج أحادي يتعامل مع الإشارات الصوتية مباشرة دون الحاجة إلى وصلة نصية وسيطة.
القيود وضوابط الأمان
من الأشياء المفيدة التي راعته شركة OpenAI، وتستحق الانتباه إليها، وضع معايير أمان صارمة لهذا الوضع لتجنّب سوء الاستخدام، ومنها:
-
منع انتحال الأصوات: اقتصار الأصوات على مجموعة من الأصوات المُسبقة المعتمدَة والمصممة بالتعاون مع ممثلين صوتيين بشريين، ومنع استخدام أو محاكاة أصوات أفراد آخرين.
-
تصفية المحتوى الصوتي: إدراج أنظمة تصفية في الوقت الفعلي، للتعرف على المحتوى الضار أو المشفر أو الانتهاكات قبل بدء عمليات توليد الصوت الفعلية.
-
استخدام الميزات المحدودة: يخضع استخدام الميزة لحدود زمنية يومية بغرض تنظيم الاستهلاك على السيرفرات لملف المشتركين.
مشاهدة
44



