دليل تحويل الصوت إلى نص — Whisper AI | إتقان

حوّل المقابلات والتسجيلات إلى نص قابل للبحث — دليل التفريغ الصوتي من إتقان.

سجّلت محاضرة مدتها 47 دقيقة على هاتفك، والموعد النهائي لتسليم ملخص مكتوب غداً صباحاً. النسخ اليدوي بوتيرة تقارب أربعة أضعاف مدة التسجيل يعني أربع ساعات لا تملكها. أداة تحويل الصوت إلى نص في إتقان تشغّل نموذج Whisper من OpenAI على ملفك — MP3 أو WAV أو M4A أو AAC أو OGG أو FLAC أو فيديو MP4/AVI/MOV — وتعيد نصاً قابلاً للتحرير بأكثر من 50 لغة. بلا تثبيت برامج وبلا حساب. في هذا الدليل نشرح اختيار نموذج Whisper، وأربعة مسارات عمل واقعية، وقائمة تحقق قبل الرفع، وكيفية صقل النص قبل النشر أو الأرشفة.

أساسيات التفريغ الصوتي

تحويل الصوت إلى نص يحوّل الكلام المسجّل إلى كتابة عبر نموذج Whisper من OpenAI. ارفع مرة واحدة واستلم مسودة خلال دقائق — عكس تحويل النص إلى صوت. تحقق من الطول عبر عداد الكلمات. الواجهة تعرض معاينة صوتية وشريط تقدّم ونسخ/تحميل في صفحة النتيجة.

لماذا تُفرّغ التسجيلات أصلاً؟

النص قابل للبحث والاقتباس وإتاحة الوصول. التفريغ يساعد المستمعين على تصفّح البودكاست، ويدعم الطلاب ذوي الإعاقة السمعية، ويمنح محركات البحث محتوى قابلاً للفهرسة.

  • تعليم: تحويل ندوة مسجّلة إلى ملاحظات دراسية دون إعادة الساعة كاملة.
  • صحافة: استخراج اقتباسات دقيقة من مقابلة مصدر مدتها 35 دقيقة.
  • أعمال: صياغة محضر اجتماع من تصدير Teams أو Zoom.
  • تسويق محتوى: إعادة استخدام فيديو مدته 22 دقيقة كمقال مدونة.
  • قانون وامتثال: مسودة أولى قابلة للبحث من إفادة مسجّلة (راجع دائماً مع الصوت الأصلي).
  • إتاحة: نشر ترجمات أو تفريغ كامل بجانب الفيديو.

الوسائط المدعومة وحدود الحجم

صيغ الصوت

MP3, WAV, M4A, AAC, OGG, FLAC. مذكرات الصوت على الهاتف غالباً M4A أو AAC؛ المسجّلات الاحترافية تصدّر WAV أو FLAC.

صيغ الفيديو (يُستخرج الصوت)

MP4, AVI, MOV. لا حاجة لفصل الصوت مسبقاً — Whisper يعالج المسار الصوتي. مفيد لتسجيلات الويبينار أو لقطات الشاشة مع تعليق صوتي أو فيديو ميداني حيث يهم الكلام فقط.

حجم الملف

كل رفع حتى 150 ميجابايت. ملفات WAV الطويلة تصل للحد أسرع — حوّل عبر محول الصوت عند الحاجة.

اختيار نموذج Whisper

يتوفر Whisper بعدة أحجام. إتقان يقدّم ثلاثة مناسبة للويب:

النموذجالسرعةالدقةالأنسب لـ
Baseالأسرعجيدة على كلام واضحمسودات سريعة، مقاطع أقل من 15 دقيقة، صوت استوديو نظيف
Smallمتوسطةأفضل مع اللكنات وضوضاء خفيفةالخيار الافتراضي لمعظم المقابلات والمحاضرات
Mediumأبطأالأعلىغرف صاخبة، متحدثون متعددون، أو نص ستنشره حرفياً

اختر كشف تلقائي للكلام المختلط؛ ثبّت العربية أو الإنجليزية للتسجيلات الأحادية. زمن المعالجة يتناسب مع المدة وحجم النموذج.

خطوات التنفيذ

  1. افتح تحويل الصوت إلى نص على الحاسوب أو الجوال.
  2. ارفع من جهازك أو Google Drive أو Dropbox، أو اسحب الملف إلى منطقة الإفلات.
  3. تأكد أن الشريط الجانبي يعرض اسم الملف وحجمه وصيغته بشكل صحيح.
  4. اختر اللغة (تلقائي أو صريح) ونموذج Whisper.
  5. استمع للمعاينة في المشغّل المدمج — تخطَّ هذه الخطوة فقط إن كنت متأكداً من سلامة الملف.
  6. اضغط ابدأ التحويل وراقب شريط التقدّم.
  7. في صفحة النتيجة، انسخ التفريغ أو حمّله كملف نصي.
  8. صحّح الأسماء والأرقام والمصطلحات التقنية قبل النشر.

محاضرة — تسجيل 90 دقيقة

طالب أحياء يسجّل مراجعة قبل الامتحان النصفي مدتها 90 دقيقة بميكروفون حاسوب على بُعد مترين من المحاضر. الملف MP3 بحجم 68 ميجابايت. الهدف: ملاحظات قابلة للبحث قبل الامتحان خلال 48 ساعة.

التحضير: استمع لأول 30 ثانية — إن كان طنين التكييف مسيطراً، مرّر الملف عبر إزالة الضوضاء أولاً ثم ارفع MP3 المنظّف.

الإعدادات: اللغة إنجليزية، النموذج Small (قد يفوّت Base «mitochondria» من بعيد؛ Medium مبالغة ما لم تكن القاعة صدّاية).

النتيجة: نحو 12,400 كلمة. الطالب يصحّح ثلاثة أسماء كيميائية ويُبرز التعريفات — 25 دقيقة تحرير مقابل 6+ ساعات كتابة يدوية.

مقابلة — مسار صحفي

مراسل يسجّل مقابلة هاتفية مدتها 38 دقيقة محفوظة M4A (22 ميجابايت). المصدر يذكر أرقام ميزانية وأسماء علمية يجب أن تكون دقيقة.

الإعدادات: كشف تلقائي (إنجليزية مع جمل إسبانية عرضية)، النموذج Medium لأن الاقتباسات ستُطبع.

المسار: ميّز الجمل التي فيها أرقام وقارن «$4.2 million» و«Q3 2025» مع الصوت. نظّف ضوضاء المقهى أولاً لتوفير وقت التحقق.

اجتماع — تصدير صوت Zoom

مدير مشروع يصدّر اجتماع Zoom مدته 52 دقيقة كـ M4A (41 ميجابايت). ثلاثة أشخاص تحدّثوا؛ يجب إيصال المهام للفريق قبل نهاية اليوم.

الإعدادات: إنجليزية، النموذج Small.

ما بعد التفريغ: Whisper لا يُسمّي المتحدثين. المدير يدرج الأسماء ويُفوّت المهام. رفع MP4 مسجّل شاشة يعمل مباشرة دون تصدير صوت منفصل.

بودكاست — ملاحظات العرض وSEO

صانع بودكاست مستقل ينشر حلقات أسبوعية بمتوسط 28 دقيقة. الحلقة 47 (MP3، 26 ميجابايت) عن «التوظيف عن بُعد في 2026».

الإعدادات: إنجليزية، Base لمسودة سريعة (المضيف يقرأ من مخطط مرن، الصوت استوديو).

إعادة الاستخدام: التفريغ بحوالي 4,800 كلمة يصبح ملخص مدونة وملاحظات عرض ونص meta. احذف أسطر الإعلانات والموسيقى الافتتاحية يدوياً.

نصائح التفريغ بالعربية

Whisper يتعامل مع الفصحى والعديد من اللهجات، لكن الدقة تتفاوت مع التبديل بين اللغات والكلام العامي السريع والأسماء المعرّبة من الإنجليزية.

  • اختر العربية صراحةً بدلاً من التلقائي عندما يكون التسجيل عربياً فقط.
  • سجّل أقرب للميكروفون — بُعد الهاتف يسبب سقوط حركات قصيرة في الكلام السريع.
  • لاجتماعات عربية–إنجليزية مختلطة، التلقائي يعمل لكن المصطلحات التجارية الإنجليزية تحتاج تصحيحاً يدوياً.
  • راجع الهمزة والتاء المربوطة في الأسماء — Whisper قد يوحّد الإملاء بشكل مختلف عن دليل أسلوبك.
  • ادمج مع إزالة الضوضاء عند التسجيل في الخارج أو مكاتب مزدحمة.

قائمة تحقق قبل الرفع

  • تأكد أن الملف يعمل من البداية للنهاية — الرفع التالف يفشل أحياناً دون تنبيه مبكر.
  • تحقق أن الحجم أقل من 150 ميجابايت؛ اضغط أو قص عند الحاجة.
  • اختر اللغة: تلقائي للكلام المختلط، صريح للعربية أو الإنجليزية الأحادية.
  • اختر النموذج: Base للسرعة، Medium لدقة جاهزة للنشر.
  • أزل الضوضاء إن كان الطنين أو الرياح يتنافس مع الكلام.
  • للفيديو، تأكد من وجود المسار الصوتي الصحيح (بعض لقطات الشاشة بلا مدخل ميكروفون).
  • تجنّب رفع تسجيلات سرية للغاية أو محمية قانونياً ما لم تسمح سياسة مؤسستك بالمعالجة السحابية.

بعد وصول النص

ناتج Whisper مسودة. خصّص 10–20% من مدة الصوت للتحرير. صحّح الأسماء، تحقق من الأرقام، أضف فقرات، واحذف الحشو للنشر. المخرجات نص عادي بلا توقيت SRT.

كيف نتعامل مع ملفاتك

تنتقل الرفوعات عبر HTTPS إلى خوادم إتقان حصراً لتشغيل Whisper. لا نستخدم تسجيلاتك لتدريب نماذج ذكاء اصطناعي، ولا نبيع الصوت للمعلنين، ولا نحتفظ بالملفات إلى ما لا نهاية. بعد اكتمال المعالجة، تُحذف الرفوعات والتفريغات المولّدة تلقائياً خلال فترة قصيرة.

رموز الجلسة في صفحة النتيجة تنتهي صلاحيتها — احفظ ملف النص المحمّل إن احتجته لاحقاً. لسياسات المؤسسة حول التفريغ السحابي، راجع سياسة الخصوصية وإشعار ملفات تعريف الارتباط وصفحة الأمان. عند مواد محمية بامتياز المحامي–الموكل أو مصنّفة، استشر فريق الامتثال قبل الرفع لأي خدمة على الإنترنت.

حدود ومزالق

  • Whisper لا يفصل المتحدثين — كتلة نص متصلة بلا تسمية «المتحدث أ».
  • الموسيقى والتصفيق والأصوات المتداخلة تُضعف الدقة؛ قص المقدمات إن أمكن.
  • اللكنات القوية أو اللغات النادرة قد تحتاج نموذج Medium مع تحرير مكثّف.
  • حد 150 ميجابايت — قسّم ملفات WAV متعددة الساعات أو حوّل لصيغ مضغوطة.
  • المخرجات نص عادي — بلا تصدير SRT/VTT مدمج مع توقيت.
  • الكشف التلقائي قد يخطئ في مقاطع أقل من 30 ثانية — حدّد اللغة يدوياً.
  • زمن المعالجة على الخادم يطول مع طول الملف؛ ابدأ المهام الطويلة عندما يمكنك الانتظار.

أسئلة شائعة

هل التحويل مجاني؟

نعم — من المتصفح دون حساب أو اشتراك.

ما الصيغ المدعومة؟

MP3, WAV, M4A, AAC, OGG, FLAC، وفيديو MP4 وAVI وMOV لاستخراج الصوت تلقائياً.

ما الحد الأقصى لحجم الملف؟

150 ميجابايت لكل رفع.

هل تُخزَّن ملفاتي دائماً؟

لا. تُعالج للتفريغ وتُزال تلقائياً بعد فترة قصيرة. لا نشاركها مع أطراف ثالثة.

هل تعمل على الجوال؟

نعم — متجاوبة على متصفحات أندرويد وآيفون. ارفع مذكرات الصوت مباشرة من هاتفك.

Base مقابل Small مقابل Medium — أيهما أختار؟

Base لمسودات سريعة على صوت نظيف. Small للاستخدام اليومي المتوازن. Medium عندما تهم الدقة أكثر من السرعة.

هل يفرّغ العربية؟

نعم — اختر العربية من قائمة اللغة أو استخدم الكشف التلقائي على تسجيلات عربية.

خلاصة

ارفع تسجيلك إلى أداة تحويل الصوت إلى نص في إتقان، اختر اللغة ونموذج Whisper، وحمّل مسودة تفريغ خلال دقائق بدلاً من ساعات. نظّف الملفات الصاخبة أولاً، اختر Medium للعمل الجاهز للنشر، وتحقق دائماً من الأسماء والأرقام مع الصوت الأصلي. من محاضرات 90 دقيقة إلى حلقات بودكاست 28 دقيقة، التفريغ الصوتي يحوّل محتوى «للاستماع فقط» إلى نص تبحث فيه وتقتبس منه وتعيد استخدامه.

من النص المستخرج إلى مسودة قابلة للنشر

بعد التحويل في الصوت إلى نص راجع الأخطاء الشائعة في الأسماء والأرقام، ثم قِس الطول عبر عداد الكلمات. إن احتجت تنظيف حالة أو تشكيل استخدم محول حالة النص. لإعادة الصوت من النص المنقّح افتح النص إلى كلام.

للتسجيلات الصاخبة مرّر الملف أولاً عبر تقليل الضوضاء أو استخرج المسار من فيديو عبر استخراج الصوت من الفيديو قبل التفريغ. سمِّ الملفات بتاريخ المتحدث لتسهيل الأرشفة.

قسّم الملفات الطويلة إلى مقاطع منطقية قبل التفريغ إن كان التسجيل يتجاوز ساعة؛ يسهل التصحيح وتتبع المتحدثين. بعد الصوت إلى نص علّم الأسماء الصحيحة مرة واحدة في مسودة الملاحظات ثم طبّق الاستبدال بحذر. للترجمة اللاحقة للنص المفرّغ استخدم المترجم بعد انتهاء التدقيق اللغوي لا قبله حتى لا تُترجم أخطاء التفريغ.

بعد التفريغ عبر الصوت إلى نص أضف علامات زمنية يدوياً عند النقاط الحاسمة إن كان الملف سيُراجع مع الفيديو الأصلي. للضوضاء المتبقية أعد المعالجة عبر تقليل الضوضاء قبل محاولة تفريغ ثانية بدل قبول نص مليء بالأخطاء. احفظ النص النهائي بصيغة يسهل البحث فيها لاحقاً ضمن أرشيف الفريق.

مكتب تفريغ بعد الاجتماعات والدورات

ارفع التسجيل إلى تحويل الصوت إلى نص بعد تنظيف الهسهسة عبر تقليل الضوضاء إن لزم. راجع الأسماء والأرقام يدوياً، ثم قس الطول عبر عداد الكلمات قبل أرشفة المحضر. للملفات المستخرجة من فيديو ابدأ بـاستخراج الصوت من الفيديو. سمِّ الملفات بتاريخ والمتحدث، ولا تترجم النص عبر المترجم قبل انتهاء التدقيق حتى لا تُثبَّت أخطاء التفريغ في لغة أخرى.

في سياق تحويل الصوت إلى نص داخل منصة إتقان، راجع الناتج مرة أخيرة قبل الإرسال، وتأكد أن الخطوات التي اتبعتها موثّقة لفريقك، وأن الروابط الداخلية للأدوات ذات الصلة ما زالت تعمل كما توقعت، وأن النسخة النهائية خالية من بقايا تجربة أو نص مؤقت تركته أثناء الكتابة. أعِد فتح الأداة إن احتجت خطوة إضافية، ولا تعتمد على الذاكرة وحدها عندما يكون القرار مالياً أو نظامياً أو مرتبطاً بموعد تسليم واضح للعميل أو للجهة الطالبة.

أضف مراجعة بشرية سريعة بعد كل معالجة رقمية تتعلق بهذا الموضوع، وسمِّ الملفات بأسماء عربية واضحة تتضمن التاريخ والغرض حتى يسهل الأرشيف لاحقاً، وتجنب خلط نسخ التجربة مع النسخ النهائية في المجلد نفسه، واطلب من زميل قراءة جملة النتيجة بصوت عالٍ إن كان الخطأ فيها مكلفاً، واحتفظ بملاحظة قصيرة عما تغيّر بين المحاولة الأولى والأخيرة قبل إغلاق الجلسة.

العودة إلى المدونة