هذه الصفحة تتحدث عن كيفية توليد الكلام: مقاطع صوتية مُجمّعة، ومُشفّرات صوتية بارامترية، وصوت خام على غرار WaveNet، والنماذج العصبية التي يستخدمها GSpeech اليوم. إنها ليست قائمة "لماذا إضافة مُشغّل؟" - هذا الأمر موجود في مزايا موقع الويب لتحويل النص إلى كلامكما أنها ليست دليلاً إرشادياً لتثبيت ووردبريس.
في الموقع المباشر، لا تختار ورقة بحثية، بل تختار صوتًا في وحدة التحكم السحابية. وبناءً على هذا الاختيار، محرك صوتي موحد يعمل بالذكاء الاصطناعي يمكن للنسخ التجارية استخدام OpenAI وGemini وGoogle Cloud وChirp3 HD وNeural2 وPolyglot وWaveNet - لا حاجة لمفاتيح API. المعالجة السحابية، وعدم تحميل الخادم، يُبقي عملية التوليف بعيدة عن مصدرك.
مسار التركيب (ما يحدث فعلياً)
اصطناع الكلام يحوّل الرموز المكتوبة إلى شكل موجي. مشغل الموقع الإلكتروني ليس سوى الخطوة الأخيرة: تشغيل ملف. العمل المثير للاهتمام يبدأ قبل ذلك.
- نص في - مقالة معزولة، أو نطاق مميز (RHT)، أو سلسلة مترجمة. العزل هو عمل المنتج، وليس ورقة عمل مشفر صوتيًا.
- التحليل اللغوي - الكلمات، النبرة، الوقفات. توجد هنا أسماء مستعارة ذكية للنطق: سلاسل العلامات التجارية التي قد يخمنها النموذج لولا ذلك.
- النموذج الصوتي - وحدات التجميع، أو مشفر صوتي بارامتري، أو شبكة عصبية تتنبأ بالصوت.
- شكل الموجة الخارجة - يتم تخزينها مرة واحدة ضمن خيار "إنشاء مرة واحدة، والاحتفاظ بها وتشغيلها"، ثم يتم بثها. المتصفح speechSynthesis يتجاهل هذا المتجر ويستخدم ما تم شحنه مع نظام التشغيل.
ثلاث عائلات من نماذج تحويل النص إلى كلام
تحويل النص إلى كلام متسلسل يخزن التطبيق مقاطع صوتية قصيرة ويعيد تجميعها. تغيير المتحدث أو الحالة المزاجية يعني عادةً تسجيل قاعدة بيانات جديدة. وقد استخدمت تطبيقات سيري الكلاسيكية هذه الفكرة.
تحويل النص إلى كلام بارامتري يحتفظ بخصائص الكلام في معلمات النموذج. غالبًا ما بدت الإصدارات المبكرة أقل طبيعية من التجميعية لأن الصوت كان يمر عبر مشفر صوتي.
تستند الأنظمة العصبية إلى هذا التاريخ. ولا تزال البنى القائمة على القواعد والإحصاءات موجودة في الكتب الدراسية. ما تسمعه في الأصوات التجارية لـ GSpeech هو توليف بالذكاء الاصطناعي: OpenAI، وGemini، وGoogle Cloud Neural2 / Polyglot / Chirp3 HD، وWaveNet - وليس بنك تجميع محلي على خادم PHP الخاص بك.
WaveNet: نمذجة شكل الموجة الخام
غيّرت تقنية WaveNet مفهوم المعالجة البارامترية من خلال التنبؤ بإشارة الصوت عينةً تلو الأخرى، بدلاً من تمرير مخطط طيفي مضغوط إلى مُشفّر الصوت. وأظهرت دراسة أجرتها جوجل عام ٢٠١٦ أن الشبكة الالتفافية المُوسّعة قادرة على تغطية آلاف الخطوات الزمنية. تتميز ملفات الصوت الخام بكثافتها العالية - عادةً ١٦٠٠٠ عينة في الثانية أو أكثر - لذا فإن توليدها باستخدام الانحدار الذاتي مُكلف، ولكنه يلتقط تفاصيل دقيقة مثل صوت الشفاه وخصائص المتحدث التي غالباً ما تغفلها المعالجة التجميعية.
بكسلرن و بيكسل سي إن إن أظهرت النتائج إمكانية توليد صورة قناةً تلو الأخرى. ويف نت هي النسخة أحادية البعد من هذه الفكرة: شبكة تلافيفية بالكامل تعمل عوامل التمدد فيها على زيادة مجال الاستقبال بشكل أُسّي.
أثناء التدريب، تكون المدخلات عبارة عن موجات صوتية مسجلة حقيقية. عند أخذ العينات، تسحب كل خطوة من التوزيع المتوقع للشبكة، وتُعيد تغذية تلك العينة، وتستمر العملية. هذه الحلقة هي السبب في أن WaveNet في بداياتها كانت مخصصة للأبحاث فقط؛ لاحقًا، تم تقليص حجمها لتصبح جزءًا من إنتاج Google TTS.
MOS والفجوة في عام 2016
تقييم جوجل WaveNet مقارنة بأفضل الأنظمة البارامترية والتسلسلية آنذاك باستخدام متوسط درجات الرأي (MOS) - تقييمات بشرية عمياء (أكثر من 500 تقييم على 100 جملة اختبارية في التقرير الأصلي). قلّصت WaveNet الفجوة المتبقية مع الكلام البشري بأكثر من النصف للغة الإنجليزية الأمريكية والصينية الماندرينية في تلك الاختبارات. يُعدّ هذا إنجازًا بحثيًا هامًا، وليس مجرد نتيجة تسويقية لـ GSpeech.
WaveNet هي إحدى عائلات محرك الصوت الموحد للذكاء الاصطناعي. مجموعات لاحقة - جيميني تي تي إس, Chirp3 HDتُعدّ Neural2 وPolyglot وOpenAI هي الخيارات التي تختارها كصوت في وحدة تحكم السحابة. لا تقوم بنشر نقطة تحقق WaveNet على WordPress.
جيميني تي تي إس: الكلام المتحكم فيه بواسطة الأوامر
تنبأت شبكة WaveNet بعينة الصوت التالية. جيميني تي تي إس يُعدّ هذا مسارًا لاحقًا لتوليد الكلام من جوجل: حيث تصف كيف يجب أن يبدو الكلام المقروء بلغة طبيعية - الأسلوب، واللهجة، والسرعة، والنبرة، والعاطفة، وطريقة الإلقاء - ويقوم النموذج بتنفيذ ذلك التوجيه. لهذا السبب يُستخدم GSpeech رسائل صوتية مخصصة و اهتزازات صوتية (الأنماط، وليس معرفات الصوت الإضافية) هي المهمة في Gemini: التحكم موجود في الموجه، وليس في بنك تجميعي جديد.
لا تزال عملية التنظيف اللغوي تتم أولاً. يمكن لأسماء النطق الذكية توسيع الاختصارات أو تثبيت رمز العلامة التجارية؛ ثم يقوم نظام Gemini بنطق السلسلة المُجهزة وفقًا للتسليم المطلوب. ملاحظات واجهة برمجة التطبيقات الرسمية: جيميني تي تي إس.
أعلى دقة في سرد Gemini عندما تكون خاصية الاستماع جزءًا من الصفحة: المنشورات الرئيسية، وشروحات العلامة التجارية، ونصوص المنتجات.
نفس لغة التوجيه الخاصة بالإصدار الاحترافي، مُحسّنة لتوليد أسرع عبر كتالوج من المنشورات أو وحدات SKU.
Gemini Pro
Gemini Pro يُعدّ نموذج Gemini لتحويل النص إلى كلام فائق الواقعية جزءًا من GSpeech. يمكنك كتابة نص صوتي مخصص كما لو كنت تُوجّه الراوي: شرح منتج أكثر هدوءًا، مدونة أكثر حيوية، لكنة أكثر دقة، وتيرة أبطأ، ومزيد من المشاعر. يبقى كود HTML المرئي نظيفًا للقراء ولمحركات البحث. لا يوجد مفتاح Gemini منفصل، ولا مشروع Google AI Studio، ولا وحدة تحكم إضافية للمزود.
من الناحية التقنية، لا يزال هذا توليفًا سحابيًا، ثم ملفًا مخزنًا. الاستماع المتكرر هو تشغيل، وليس عملية ذهاب وإياب جديدة إلى Gemini. استخدم Pro عندما يكون الصوت هو التجربة - مقال رئيسي أو صفحة منتج حيث يجب أن يكون العرض موجهًا، وليس عامًا.
Gemini Flash
Gemini Flash ينتمي هذا البرنامج إلى عائلة Gemini TTS نفسها، وهو مصمم خصيصًا للسرعة. تتطابق مفردات التوجيه الصوتي مع النسخة الاحترافية (من حيث الأسلوب واللهجة والسرعة والنبرة والعاطفة وطريقة الأداء)، مما يتيح لك كتابة توجيه صوتي مرة واحدة وإعادة استخدامه، بينما يعمل Flash على تسريع تحميل الصفحات. يُعد هذا البرنامج مثاليًا لإدارة الكتالوجات، حيث يدعم العديد من المنشورات ووصف WooCommerce والمسودات متعددة اللغات. يمكنك ترقية رابط الصفحة الرئيسية إلى النسخة الاحترافية عندما ترغب في الحصول على أقصى أداء ممكن.
Chirp3 HD: Google Cloud’s current HD neural family
Chirp3 HD ليس الأمر مجرد "WaveNet باسم جديد". قام WaveNet (2016) بنمذجة الصوت الخام باستخدام الالتفافات المتوسعة. لا تزال أصوات Neural2 وPolyglot وWaveNet موجودة في كتالوج Google Cloud ( 230+ الطابق: قياسي، ويف نت، نيورال 2، متعدد اللغات، رحلة، استوديو، أخبار). Chirp3 HD هو أحدث جيل من تقنية تحويل النص إلى كلام السحابية عالية الدقة من جوجل - مصمم لتحقيق الواقعية والنبرة الطبيعية بدلاً من القراءة بصوت عالٍ رتيبة. ملاحظات رسمية: Chirp 3 HD.
داخل GSpeech، يُعد Chirp3 HD صوتًا من وحدة تحكم السحابة: لا يتطلب مشروعًا على Google Cloud، ولا ملف JSON لحساب الخدمة. أنت من يختار الصوت؛ ويتم تشغيل عملية التوليف من مصدرك؛ ويتم تخزين الملف وتشغيله عبر شاشة كاملة، أو زر، أو دائرة، أو نافذة عائمة، أو سياق، أو RHT. تبقى السرعة ودرجة الصوت في وحدة التحكم. أما أسماء العلامات التجارية، فتظل ضمن أسماء النطق الذكية - وهذه الطبقة مستقلة عن عائلة Google التي اخترتها.
متى تختار Chirp3 HD مقابل Gemini؟ اختر Chirp3 HD عندما تريد جودة إنتاج عالية الدقة من Google Cloud وقراءة متسقة بغض النظر عن الجهاز. اختر Gemini Pro / Flash عندما تريد تحكمًا في أسلوب وعاطفة التوجيهات الصوتية باللغة الطبيعية. كلاهما مساران تجاريان لمحركات الصوت الموحدة بتقنية الذكاء الاصطناعي. إجمالي المحرك هو 300+ صوت في ۱٦ لغة (يتطلب الأمر حوالي 30 × 3 من Gemini لـ Chirp 3 HD و Flash و Pro لكل لغة، بالإضافة إلى OpenAI 11 × 2، بالإضافة إلى كتالوج Google Cloud). أنماط الصوت هي أنماط، وليست معرّفات إضافية.
- Neural2 - أصوات عصبية إنتاجية مستخدمة على نطاق واسع في نفس كتالوج Google Cloud.
- متعدد اللغات - أداء أقوى في التعامل مع اللغات المتعددة / عبر اللغات.
- WaveNet - عائلة الموجات الخام لعام 2016، والتي لا تزال متاحة كأصوات كتالوج، ليست المسار الوحيد لشركة جوجل.
محرك الصوت الموحد بالذكاء الاصطناعي مقابل تحويل النص إلى كلام في المتصفح
الجهاز speechSynthesis هي واجهة برمجة تطبيقات محلية. تختلف الأصوات باختلاف نظام التشغيل. لا يوجد خيار "إنشاء مرة واحدة، والاحتفاظ، وتشغيل"، ولا مزامنة صوتية ذكية عند تغيير نسخة نظام إدارة المحتوى، ولا طبقة توجيه Voice Vibes. تعالج خدمة GSpeech Cloud Processing النموذج في السحابة، وتخزن الملف، ثم تقوم الأداة بتشغيله. لا تؤدي مشكلات الإنشاء المؤقتة إلى حذف الملفات التي تم إنشاؤها مسبقًا. لا تُحذف الملفات عند عودة الحساب إلى الخطة المجانية. ويستمر الإنشاء الجديد وفقًا للخطة النشطة.
models: "OpenAI, Gemini, Google Cloud, Chirp3 HD, Neural2, Polyglot, WaveNet"
langs: "98 languages, 300+ voices (commercial)"
control: "Voice Vibes + Smart Pronunciation Aliases"
keys: "No API Keys Required"
تُعدّ Voice Vibes (التجارية) نمطًا يُطبّق على جانب الموجه الصوتي، وليست بنكًا جديدًا للأصوات. تُحدّد الأسماء المستعارة طريقة نطق الرمز دون تغيير HTML المرئي. كلاهما طبقات تحكم فوق أي نموذج صوتي اختاره المحرك لهذا الصوت.
الأسئلة الشائعة حول تقنية تحويل النص إلى كلام
النماذج وخطوط الأنابيب - وليس إعداد المكونات الإضافية.
-
هل يستخدم GSpeech تقنية WaveNet في كل عملية استماع؟
لا، WaveNet هي إحدى عائلات Google العديدة. كما يقوم محرك الصوت الموحد للذكاء الاصطناعي بتوجيه Neural2 وPolyglot وChirp3 HD وGemini وOpenAI حسب الصوت الذي تختاره. تعني خاصية "إنشاء مرة واحدة، وحفظ، وتشغيل" أن عمليات التشغيل المتكررة تستخدم الملف المخزن، وليس عينة صوتية جديدة مُخصصة للبحث.
-
لماذا لا يزال يتم ذكر تقنية تحويل النص إلى كلام التجميعية؟
إنها القاعدة التاريخية: دمج الوحدات المسجلة. تولد النماذج العصبية الصوت بدلاً من دمج المقاطع الصوتية. إن فهم الفرق بين التجميعي وWaveNet يفسر سبب قدرة الأصوات التجارية الحديثة على تغيير أسلوبها دون الحاجة إلى جلسة تسجيل جديدة.
-
هل يمكنني تشغيل هذه النماذج على خادمي الخاص؟
منتج موقع GSpeech الإلكتروني هو معالجة سحابية، بدون تحميل على الخادم. لا تحتاج إلى استضافة WaveNet أو Gemini أو OpenAI على WordPress. لا حاجة لمفاتيح API: تبقى الفواتير والمفاتيح في وحدة تحكم السحابة.
-
هل تنطبق معايير MOS لعام 2016 على GSpeech اليوم؟
الرسم البياني لمؤشر جودة الصوت (MOS) في هذه الصفحة هو تقييم جوجل المنشور لشبكة WaveNet. لا تدّعي GSpeech أن هذا الرقم ينطبق على جميع الأصوات الحالية. تعتمد الجودة التجارية الحالية على مزيج المحركات المذكور أعلاه، وليس على إعادة نشر مؤشر جودة الصوت لعام 2016 كنتيجة للمنتج.
-
Gemini Pro مقابل Gemini Flash - ما الفرق؟
تستخدم هذه النسخة نفس عائلة Gemini TTS ونفس لغة التوجيه الصوتي المخصصة (الأسلوب، اللهجة، السرعة، النبرة، العاطفة، الأداء). تُعدّ نسخة Flash أسرع للكتالوجات، بينما تُقدّم نسخة Pro جودةً أعلى للصفحات الرئيسية. لا تتطلب أيٌّ منهما مفتاح Gemini API في GSpeech، حيث يمكنك اختيار الصوت من لوحة التحكم السحابية.
-
هل Chirp3 HD هو نفسه WaveNet؟
لا. WaveNet هي عائلة نماذج الموجات الصوتية الخام من جوجل لعام ٢٠١٦. أما Chirp3 HD فهو جيل أحدث عالي الدقة من تقنية تحويل النص إلى كلام السحابة، يتميز بالواقعية والنبرة. لا تزال أصوات Neural2 وPolyglot وWaveNet موجودة في كتالوج جوجل كلاود (أكثر من ٢٣٠ صوتًا). يعرض GSpeech صوت Chirp3 HD كصوت أساسي دون الحاجة إلى مشروع على جوجل كلاود.
من الورق إلى صوت في وحدة التحكم
تُعدّ البنوك التجميعية، ومشفّرات الصوت البارامترية، وتقنية WaveNet القائمة على الموجات الخام، من أهمّ أصول هذه التقنية. يُضيف Gemini TTS (Pro / Flash) ميزة التحكم في الإرسال عبر الأوامر الصوتية؛ بينما يُمثّل Chirp3 HD عائلة Google Cloud الحالية من الشبكات العصبية عالية الدقة. على موقع GSpeech، يُمكنك الاستماع إلى مُحرّك الصوت الموحّد بالذكاء الاصطناعي الحالي من خلال أداة مصغّرة - صفحة كاملة، زر، دائرة، أو اقرأ النص المميز (RHT) - مع الاحتفاظ بالملفات بعد إنشاء النسخة الأولى. للاطلاع على مقالة "هل يجب أن يحتوي عنوان URL الخاص بي على مشغل؟"، راجع مقالة "الفوائد". للاطلاع على نقرات لوحة تحكم ووردبريس، راجع دليل الاستخدام.
