تقدم أداة «Voicebox» تصوراً مختلفاً لخدمات الصوت بالذكاء الاصطناعي، إذ تعمل محلياً على جهاز المستخدم، من دون الحاجة إلى رفع التسجيلات الصوتية أو البيانات إلى خوادم خارجية.
وتجمع الأداة في تطبيق واحد مجموعة من أدوات الذكاء الاصطناعي الصوتية. كما تشمل استنساخ الأصوات وتحويل النص إلى صوت والإملاء الصوتي وتحرير المشروعات متعددة المسارات، إضافة إلى ربطها بمساعدات الذكاء الاصطناعي.
ويستهدف المشروع صناع المحتوى والمطورين ومنتجي البودكاست، خصوصاً من يبحثون عن بديل مجاني للخدمات السحابية المدفوعة، مع تحكم أكبر في الملفات والبيانات الصوتية.
استنساخ الصوت من عينة قصيرة
تتيح «Voicebox» للمستخدم تسجيل عينة صوتية أو رفع ملف جاهز، ثم إنشاء صوت رقمي يمكن استخدامه لقراءة نصوص جديدة.
ويمكن للأداة العمل انطلاقاً من عينة قصيرة تبدأ من بضع ثوانٍ، لكن جودة النتيجة تعتمد على وضوح التسجيل، وغياب الضوضاء والموسيقى، وطول العينة، إضافة إلى المحرك المستخدم وقوة الجهاز.
ولا يعني ذلك أن النتيجة ستكون مطابقة تماماً للصوت الأصلي في كل مرة؛ إذ قد تختلف اللهجة أو سرعة النطق أو درجة التعبير بين نموذج وآخر.
سبعة محركات صوتية معاً
تجمع الأداة سبعة محركات لتحويل النص إلى صوت، من بينها «Qwen3-TTS» و«Kokoro» و«TADA» و«Chatterbox Multilingual».
وتختلف هذه المحركات في السرعة والجودة ودعم اللغات. ويأتي دعم العربية بصورة أساسية عبر محرك «Chatterbox Multilingual»، الذي يدعم 23 لغة، من بينها العربية والإنجليزية والصينية والفرنسية والألمانية واليابانية والتركية.
كما توفر بعض المحركات مؤثرات صوتية وتعبيرية، مثل الهمس والضحك والتنهد، إلا أن هذه المزايا لا تعمل بالطريقة نفسها في جميع النماذج.

ميزات المشروع
لا تقتصر «Voicebox» على تحويل النصوص إلى ملفات صوتية، إذ تحتوي على محرر متعدد المسارات يسمح بإنشاء قصص وحوارات بأكثر من صوت، مع قص المقاطع وترتيبها ودمجها داخل مشروع واحد.
وتتضمن الأداة أيضاً مؤثرات للتحكم في طبقة الصوت ومستواه، وإضافة الصدى والتأخير والضغط الصوتي، مما يجعلها أقرب إلى استوديو مبسط لإنتاج المقاطع الصوتية.
كما تستطيع معالجة النصوص الطويلة من خلال تقسيمها إلى أجزاء، ثم توليد كل جزء ودمج المقاطع تلقائياً، وهو ما يفيد في قراءة المقالات والسيناريوهات والقصص الطويلة.
الكتابة بالصوت
تضم الأداة ميزة للإملاء الصوتي تعتمد على نموذج «Whisper»، بحيث يستطيع المستخدم التحدث داخل أي تطبيق، ثم تحويل كلامه إلى نص ولصقه مباشرة في المكان المحدد.
وتوفر عدة أحجام من النموذج، تبدأ بخيارات خفيفة وسريعة، وتصل إلى نماذج أكبر تحتاج إلى موارد أعلى، لكنها قد تقدم دقة أفضل.
كما يمكن استخدام نموذج لغوي محلي لتنظيف النص، وتصحيح علامات الترقيم، وإزالة كلمات التردد والتوقفات غير الضرورية.
ربطها بأدوات الذكاء الاصطناعي
تدعم «Voicebox» بروتوكول سياق النماذج «MCP»، مما يسمح بربطها بأدوات مثل «Claude Code» و«Cursor» و«Cline».
ومن خلال هذا الربط، يمكن للمساعد الذكي قراءة الردود أو ملخصات المهام بصوت يختاره المستخدم، بما في ذلك الأصوات التي جرى استنساخها داخل الأداة. وتستفيد هذه الميزة خصوصاً في بيئات البرمجة والعمل الطويل، إذ يمكن للمساعد الإعلان صوتياً عن انتهاء مهمة أو قراءة ملخص للنتائج.

خصوصية المستخدم
تمثل الخصوصية نقطة القوة الأساسية في «Voicebox»، إذ تعمل النماذج والملفات الصوتية داخل الجهاز، ولا تتطلب الأداة حساباً أو اشتراكاً شهرياً أو رسوماً على عدد الأحرف والدقائق.
لكن التشغيل المحلي يعني أن المستخدم يحتاج إلى تنزيل نماذج قد يصل حجم بعضها إلى عدة غيغابايت، كما تعتمد سرعة التوليد وجودته بصورة مباشرة على مواصفات الجهاز.
وتعمل الأداة على أجهزة «ماك» بمعالجات «Apple Silicon» و«Intel»، وعلى أجهزة «ويندوز» بنظام 64 بت، بينما يحتاج مستخدمو «لينكس» إلى بناء البرنامج من الشفرة المصدرية أو استخدام «Docker».
مشروع واعد لكنه غير مكتمل
حقق المشروع انتشاراً واسعاً في مجتمع البرمجيات المفتوحة المصدر، وجمع عشرات الآلاف من النجوم على منصة «GitHub».
ومع ذلك، لا تزال هناك ملاحظات تتعلق بالتثبيت وتنزيل النماذج والتوافق مع بعض بطاقات الرسوميات، إضافة إلى تفاوت واضح في الأداء بين جهاز وآخر.
كما أن المشروع يطوره شخص واحد بوصفه مشروعاً جانبياً، وهو ما يفسر عدم وصوله حتى الآن إلى مستوى السهولة والثبات الذي توفره بعض الخدمات التجارية الكبرى.
هل ينافس «ElevenLabs»؟
تقدم «Voicebox» مزايا جذابة، أبرزها المجانية والخصوصية وغياب حدود الاستخدام، لكنها لا تعد بديلاً مثالياً لـ«ElevenLabs» لدى جميع المستخدمين.
فالخدمات السحابية غالباً ما توفر نتائج أكثر ثباتاً وسرعة، لأنها تعتمد على خوادم قوية ولا تشترط امتلاك جهاز بمواصفات مرتفعة.
أما «Voicebox»، فتناسب بصورة أكبر من يهتمون بالخصوصية، أو يرغبون في تجربة نماذج متعددة، أو يحتاجون إلى تشغيل الصوت محلياً وربطه بأدوات الذكاء الاصطناعي.
الاستخدام المسؤول
تثير تقنيات استنساخ الصوت مخاوف تتعلق بانتحال الشخصيات وإنتاج تسجيلات مضللة، لذلك ينبغي استخدام الأداة فقط مع الأصوات التي يملك المستخدم حق استعمالها، أو بعد الحصول على موافقة أصحابها.
وفي المحصلة، تقدم «Voicebox» نموذجاً واعداً لمستقبل أدوات الصوت المحلية، إذ تجمع استنساخ الصوت والإملاء والتحرير داخل تطبيق واحد، مع إبقاء البيانات داخل الجهاز. ورغم أنها لا تزال تحتاج إلى مزيد من التحسين، فإنها تفتح الباب أمام استخدام تقنيات الصوت بالذكاء الاصطناعي بحرية أكبر وتكلفة أقل.
