June 5, 2026
በትርጉም ኢንዱስትሪ ውስጥ በበቂ ሁኔታ የማንነጋገረው ነገር ላይ የውስጥ ሙከራዎችን እያደረግሁ ነው ፡ የተለያዩ የ AI ስርዓቶች በተለያየ መንገድ ይተረጉማሉ ወይ ሳይሆን፣ የተለያዩ የተመሳሳይ AI ስሪቶች በተለያየ መንገድ ይተረጉማሉ ወይ — እና በምን ያህል መጠን ነው።
ባለፈው ሳምንት አንድ የስፓኒሽ አባባልን MachineTranslation.com's internal testing platform ላይ በአምስት የ ChatGPT ስሪቶች በአንድ ጊዜ አሳለፍኩት። የመጣው ነገር አስደነገጠኝ።
ሁለት ስሪቶች በእንግሊዘኛ አይገባውም የሆነ ትርጉም ሰጡ። ሶስት ቅጂዎች ትክክለኛውን የቋንቋ አገላለጽ ትርጉሞች አዘጋጅተዋል። እናም ትክክለኛዎቹ ሦስቱ አልተስማሙም።
ሁሉም አምስቱም ChatGPT ናቸው። ሁሉም አምስቱም የOpenAI ናቸው። אותה בינה מלאכותית, מודל אחר — והתוצאות לא יכלו להיות שונות יותר.
אני חולק את זה עכשיו כי אני חושב שזה חשוב, לא כי יש לי תשובות ברורות. አላደርገውም። ነገር ግን ምልከታው በቂ አስደሳች ከመሆኑ የተነሳ ወደ ዓለም ሊገባ ይችላል።
የሞከርኩት ሐረግ llevarse el gato al agua.

እያንዳንዱ ስሪት ያመረተው ይኸውና፦
| ሞዴል | ውጤት | አባባላዊ? |
|---|---|---|
| ChatGPT::GPT-4o-MINI | "ድመቷን ወደ ውሃው መሸከም" | ❌ ትርጉማዊ |
| ChatGPT::GPT-4.1-NANO | "ድመቷን ወደ ውሃው መሸከም" | ❌ ትርጉማዊ |
| ChatGPT::GPT-4.1-MINI | "በስኬት ማከናወን" | ✅ ትክክል |
| ChatGPT::GPT-5.4-MINI | "የአንድን ሰው መንገድ ማግኘት" | ✅ ከፊል |
| ChatGPT::GPT-5.4 | "በላይ መውጣት" | ✅ ትክክል |
ሐረጉ ማለት ከችግር ጋር አንድን ነገር ማሳካት፣ አስቸጋሪ ድልን ማግኘት ማለት ነው። ከድመቶችም ሆነ ከውሃ ጋር ምንም ግንኙነት የለውም። ትርጉሙ ትክክለኛ ትርጉም አይደለም። ይህ ሐረጉን ቃላት በቃላት የመጻፍ ሂደት ሲሆን ሞዴሉ እንደ ምሳሌያዊ አነጋገር ሊገነዘበው አልቻለም።
GPT-4o-MINI እና GPT-4.1-NANO ተመሳሳይ ውጤቶችን ሰጥተዋል። አይመሳሰልም፣ አንድ አይነት ነው። የእኛ የትርጉም ግንዛቤዎች ይህንን በቀጥታ ጠቁመዋል፡ GPT-4.1-nano እና GPT-4o-mini አንድ አይነት ትርጉሞችን ይጋራሉ፣ ይህም ከቃል ትርጉም ይልቅ የቃል ትርጉምን ያጎላል ።
GPT-4.1-MINI፣ GPT-5.4-MINI እና GPT-5.4 እያንዳንዳቸው ሊታወቅ የሚችል ትክክለኛ ነገርን አፍርተዋል — ግን እርስ በርሳቸው ተመሳሳይ አይደሉም።
ለምን llevarse el gato al agua የዘፈቀደ ሳይሆን ጠቃሚ የሙከራ ግብአት እንደሆነ በትክክል መግለጽ እፈልጋለሁ።
በደንብ የተመሰረተ አባባል ነው። በጽሑፍ፣ በጋዜጠኝነት እና በዕለታዊ ንግግር ውስጥ ይታያል። ግልጽ ነው። በስፓኒሽ ጽሑፍ ላይ የሰለጠነ ማንኛውም ሞዴል ሊያገኘው ይገባል። ጥያቄው ሞዴሉ ሐረጉን አይቶታል ወይ የሚለው አይደለም። ጥያቄው ከእርሱ ጋር ምን እንደሚሰራ ነው።
በአባባል ትርጉም ውስጥ በጣም የከፋው የውድቀት ሁኔታ መጥፎ ትርጉም አለመስጠት ነው። እሱም የትርጉም ቋንቋውን ለማያውቅ ሰው ተቀባይነት ያለው የሚመስል ትክክለኛ ትርጉም እያደረገ ነው። ድመትን ውሃ መሸከም ትክክለኛ የእንግሊዝኛ ሰዋስው ነው።
ይህ በትክክል ተገንብቷል። ይህ የሆነ ነገር ሊያመለክት የሚችል ነገር ይመስላል። ስፓኒሽ የማይናገር ተጠቃሚ ሊያነበው፣ ራሱን ነቀነቅና ሊሄድ ይችላል — የመጀመሪያው ትርጉም ሙሉ በሙሉ እንደጠፋ ሳያውቅ።
እኔ የማስበው የውድቀት ሁኔታ ይህ ነው። ስህተት ግልጽ የሆነው አይደለም። ያልታየው.
እዚህ ያለው ንድፍ ድንገተኛ አይደለም። ሁለቱ ሞዴሎች ትክክለኛ ትርጉሞችን የሰጡት (GPT-4o-MINI እና GPT-4.1-NANO) ሁለቱም አነስተኛ እና ቀላል ክብደት ያላቸው ሞዴሎች ለፍጥነት እና ለወጪ ቅልጥፍና የተመቻቹ ናቸው። ሶስቱ ሞዴሎች አገራዊ ትርጉሞችን የሰጡ (GPT-4.1-MINI, GPT-5.4-MINI, GPT-5.4) የተለያየ ትውልድ ወይም የፓራሜትር ሚዛን ይወክላሉ።
ይህም እኔ የማስበው ያልተጠና ነገር ይጠቁማል፡ አገራዊ ብቃት በትርጉም ውስጥ ከሞዴል አቅም ጋር በሚታይ መልኩ የሚለካ ሲሆን ይህም በአጠቃላይ መመዘኛዎች ላይ የማይታይ ነው።
አጠቃላይ የቋንቋ መመዘኛዎች አስተሳሰብን፣ እውቀትን፣ ኮዲንግን፣ ሒሳብን ይፈትሻሉ። እነሱ በተለምዶ አንድ ሞዴል ዝናብ እየዘነበ ድመቶችና ውሾች እየወረዱ ነው ከሚለው የአየር ሁኔታ ጋር እንደማይገናኝ ወይም ድመትን ማርጠብ ከሚለው ጋር ድመትን ወደ ውሃ መውሰድ እንደማይገናኝ መለየት ይችል እንደሆነ አይፈትሹም። ምሳሌያዊ አባባሎች በባህል እውቀት፣ በዐውደ-ጽሑፍ ማስተዋል እና በስርዓተ-ጥለት እውቅና መገናኛ ላይ ይገኛሉ — እና ያ መገናኛ አነስተኛ ሞዴሎች ሁልጊዜ የማያሟሉት የሞዴል አቅም ገደብ
ያስፈልገዋል ብዬ አላምንም። እኔ የማላስተባብለው ነገር፡- ትላልቅ ሞዴሎች ሁልጊዜ የተሻሉ ተርጓሚዎች ናቸው የሚለውን ነው። ለዚህ እንደ አጠቃላይ ደንብ ማስረጃ የለኝም። እኔ የምመለከተው፡ በተለይ ለቋንቋዊ ይዘት፡ የቤተሰብ ውስጥ የትርጉም ልዩነት ከጠበቅሁት በላይ ነበር።
አብዛኛዎቹ የAI ትርጉም መሣሪያዎችን የሚጠቀሙ ተጠቃሚዎች የትኛውን የAI ስሪት እንደሚጠቀሙ አያውቁም። ምርትን ይከፍታሉ፣ የቋንቋ ጥንድ ይመርጣሉ፣ እና ውጤት ያገኛሉ። የሞዴል ሩቲንግ ለእነሱ የማይታይ ነው።
ይህም በትልቅ ደረጃ ላይ አስፈላጊ ነው። ማሽን ትራንስሌሽን ዶት ኮም በ90 ቀናት ውስጥ በመቶ ሺዎች የሚቆጠሩ የእንግሊዝኛ-ወደ-ስፓኒሽ የትርጉም ስራዎችን አከናውኗል። ከእነዚያ ሥራዎች ውስጥ ከፍተኛው ድርሻ ፈሊጣዊ ይዘቶችን (የግብይት ቅጂ፣ የሕግ ቋንቋ፣ የስነ-ጽሑፍ ጽሑፍ፣ የዕለት ተዕለት ግንኙነት) የሚነካ ከሆነ እና እነዚያን ሥራዎች የሚያቀናጀው መሣሪያ ተጠቃሚዎችን ሳያውቁ ወደ አነስተኛ ሞዴል የሚመራ ከሆነ፣ “ድመቷን ወደ ውኃው መውሰድ” (to carry the cat to the water) የሚለው ሐረግ በገሃዱ ውጤቶች፣ በእውነተኛ ሰነዶች ላይ፣ ውጤቱን ባመኑ እውነተኛ ሰዎች ላይ ይታይ ነበር።
የትርጉም ኢንዱስትሪው የኤአይ (AI) አቅራቢዎችን በማነጻጸር ዓመታትን አሳልፏል። ዲፕኤል (DeepL) ከጉግል (Google) ጋር። ክሎድ ከቻት ጂፒቲ ጋር። እነዚያ ንጽጽሮች ጠቃሚ ናቸው። ነገር ግን በአንድ አቅራቢ ውስጥ፣ የሥሪት ልዩነት እንዲሁ ጉልህ ሊሆን ይችላል — እና አብዛኛዎቹ የማነጻጸሪያ ማዕቀፎች ሞዴል-ሥሪት ደረጃ ላይ ስለማይፈትሹ የማይለኩት ልዩነት ነው።
አንድ ሰው ለትርጉም ChatGPT እጠቀማለሁ ሲል፣ ያ ዓረፍተ ነገር ትርጉም ያለው ለመሆን በቂ አይደለም። የትኛው ChatGPT? ናኖ? 4o-mini? 4.1-mini? 5.4? መልሱ ቢያንስ ለገላጭ ይዘት ትርጉም በሌለው መልኩ ውጤቱን ይለውጣል ።
ይህ በጣም የሚያስደስተኝ ክፍል ነው፣ እና እስካሁን ሙሉ በሙሉ ምን ማድረግ እንዳለብኝ አላወቅኩትም።
ገላጭ ትርጉሞችን የሰጡት ሦስቱ ሞዴሎች ሦስት የተለያዩ ሰጥተዋል:
ሦስቱም የllevarse el gato al aguaየሚለውን የእንግሊዘኛ አገላለጽ መከላከል ይቻላል። ነገር ግን እነሱ ተመጣጣኝ አይደሉም።
“መፈጸም” የሚለው ቃል ከችግር ጋር በማነፃፀር አፈጻጸምን ያጎላል፤ ከባድ ነገር አድርገሃል እናም ሰርቷል። የራሱን መንገድ ለማግኘትየፈለከውን ውጤት ማሳካት ላይ ያተኩራል ፣ በችግር ላይ ያነሰ ትኩረት በማድረግ። ከፍተኛ ደረጃ ላይ መውጣት ከሌሎች ጋር በማሸነፍ ተወዳዳሪ ድልን ያጎላል።
የመጀመሪያው የስፓኒሽ አባባል ከእነዚህ ውስጥ ለመጀመሪያው ቅርብ ነው። ይህ ሐረግ ተቃውሞን ማሸነፍን ያመለክታል እንጂ አንድን ውጤት ብቻ መምረጥና እንዲፈጸም ማድረግ አይደለም። ነገር ግን “የራሱን መንገድ ማግኘት” እና “ከፍተኛ ደረጃ ላይ መውጣት” ስህተት አይደሉም፣ እነሱ በተለያዩ አቅጣጫዎች ትክክል ያልሆኑ ናቸው።
ይህም በእውነት ከባድ ሆኖ ያገኘሁት ጥያቄ ያስነሳል፡ ሶስት ሞዴሎች እያንዳንዳቸው ትክክለኛ ግን የተለያየ የትርጉም ትርጉም ሲሰጡ፣ የትኛው የተሻለ እንደሆነ እንዴት ይገመግማሉ? የBLEU ውጤቶች ከ ማጣቀሻ ትርጉም ጋር ያወዳድራሉ - ነገር ግን ማጣቀሻውን የጻፈው ማን ነው፣ እና ከእነዚህ ሦስቱ የትኛውን ይመርጥ ነበር?
የእኛ AI የትርጉም ወኪል፣ ለእሱ ክብር፣ ለማንኛውም ውፅዓት ከመመዝገቡ በፊት ትክክለኛውን ጥያቄ ጠየቀ : በዚህ አውድ ውስጥ 'llevarse el gato al agua' ያለው ትርጉም ምንድን ነው? ሶስት አማራጮች ቀርበው ነበር—አስቸጋሪ ግብን ማሳካት፣ አላስፈላጊ ነገር መውሰድ፣ ወይም አደገኛ እንቅስቃሴ ማድረግ። ያ ጥያቄ ውበትን ለማሳየት አይደለም። ይህ የትርጉም ሥራ ከመጠናቀቁ በፊት የዐውደ-ጽሑፉን አለመጣጣም የሚፈታበት ዘዴ ነው።
ነገር ግን ነጥቡ ጸንቷል፡ ሦስት ትክክለኛ መልሶች፣ ሦስት የተለያዩ የትርጉም ጥላዎች። የትርጉም ማሻሻያ መሣሪያዎች ለዚህ ዓይነት ልዩነት አልተሠሩም ።
ስለ የዚህ ፈተና ገደቦች ሐቀኛ መሆን እፈልጋለሁ።
አንድ አባባል፣ አንድ የቋንቋ ጥንድ፣ የአንድ ቀን የውስጥ ምርመራ። ያ ጥናት አይደለም። ይህ ምልከታ ነው። እነዚህ ሞዴሎች (ትናንሽ ሞዴሎች ወደ ቃል በቃል መተርጎም እና ትልልቅ ሞዴሎች ወደ አገላለጽ መተርጎም) በተከታታይ የሚሰራ መሆኑን አላውቅም:
ይህም በነዚህ ሞዴሎች ውስጥ የተረጋጋ ንብረት መሆኑን ወይም ከዝማኔዎች እና ከጥሩ ማስተካከያዎች ጋር የሚቀያየር መሆኑን አላውቅም። የሞዴል አቅራቢዎች የትርጉም-ተኮር የለውጥ መዝገቦችን አያሳትሙም። ዛሬ llevarse el gato al agua በትክክል የሚያስተናግድ የሞዴል ስሪት በሚቀጥለው ወር ሊዘመን ይችላል፣ እና እኛ የማወቅ ምንም መንገድ አይኖረንም።
የምችለውን አውቃለሁ፡ ይህ ሙከራ በቂ የሆነ ፍላጎት ያለው ውጤት አስገኝቷል፣ ይህም በበለጠ ስልታዊ በሆነ መንገድ፣ በብዙ የቋንቋ ጥንዶች እና የይዘት አይነቶች ላይ ተጨማሪ ሙከራዎችን ማካሄድ እፈልጋለሁ። ባለኝ ነገር ስካፈል እችላለሁ።
በዚህ ፈተና የተነሱብኝን ሁለት ጥያቄዎች ይዤ እጨርሳለሁ። እነሱንም አልመልስም ፣ ገና ያንን ለማድረግ የሚያስችል መረጃ የለኝም። ነገር ግን እነዚህን ጥያቄዎች መጠየቅ ትክክል ይመስለኛል።
መጀመሪያ፡ በምን የፓራሜትር ገደብ የቋንቋ ብቃት አስተማማኝ ይሆናል?
ከGPT-4o-MINI እና GPT-4.1-NANO (ሁለቱም ትርጉማዊ) ወደ GPT-4.1-MINI (አገራዊ) የሚደረገው ዝላይ እንደሚያመለክተው በዚያ የመጠን ክልል መካከል ባሉ የሞዴል መጠኖች መካከል አንድ ገደብ አለ የአገራዊ እውቅና የሚበራበት። ተከታታይ ነው? ይህ ሁሉንም ቋንቋዎች በሚሸፍኑ አባባሎች ላይ ይሠራል ወይስ በሥልጠናው መረጃ ውስጥ ቋንቋው ምን ያህል በደንብ እንደቀረበ ይወሰናል? አላውቅም። ነገር ግን ማወቅ ለማንኛውም የትርጉም የስራ ፍሰት ለሚገነባ ሰው ጠቃሚ ይሆናል።
ሁለተኛ: የሞዴል ስሪት ግልጽነት ማጣት በብዛት ለተጠቃሚዎች ምን ያህል ያስከፍላል?
አንድ ተጠቃሚ በወር 1,000 ሰነዶችን በሚጠቀም መሳሪያ በኩል የሚያልፍ ከሆነ (እና ከእነዚህ ሰነዶች ውስጥ አንዳንዶቹ የአገላለጽ ይዘት ያላቸው) የትኛው የሞዴል ስሪት ጥቅም ላይ እንደሚውል የማይገልጽ ከሆነ፣ ምን ያህል ጊዜ አንድን ቃል በቃል አለመሳካት በግልጽ በማይታይ ሁኔታ ይከሰታል? እንዴት ያውቁታል? የማያውቁትን የማያውቁትን እውነታዊ ዋጋ ስንት ነው?
አሁን እየተሰራጨው ካለው ለትርጉም ምርጡ AI ምንድነው ከሚባሉ ንፅፅሮች ውስጥ አብዛኛው ይሄ ነው ብዬ አስባለሁ። መልሱ ትልቁን ሞዴል ተጠቀም የሚል አይደለም። መልሱ እንዲህ ሊሆን ይችላል፦ የምትጠቀመውን እወቅ፣ የራስህን ሙከራዎች በራስህ ይዘት ላይ አድርግ፣ እና ከአንድ አቅራቢ ስም የዋስትና የሞዴል ክልላቸውን በተከታታይ ባህሪ ማረጋገጥን አትጠብቅ። ያም ማለት፣ ቢያንስ፣ ከዚህ ሙከራ የምወስደው ይህንኑ ነው።
በዚህ ነጠላ ሙከራ ላይ በመመስረት፡ አነስተኛ፣ ለብቃት የተመቻቹ ሞዴሎች በተመሳሳይ የአይአይ ቤተሰብ ውስጥ አንድ በደንብ የተቋቋመ የስፓኒሽ አገላለጽን በጥሬ ትርጉም ሰጡ፣ ትልልቅ/አዲስ ስሪቶች የተመሳሳይ ሞዴል ትክክለኛ የትርጉም አገላለጾችን አፍርተዋል። ይህ የቋንቋ ዘይቤ ምድቦች እና የቋንቋ ጥንዶች ሁሉንም ያጠቃልል እንደሆነ ቀጣዩ ጥያቄ ነው። ተጨማሪ ምርመራዎችን
GPT-4.1-MINI፣ GPT-5.4-MINI እና GPT-5.4 ሁሉም llevarse el gato al agua የሚለውን አገላለጽ በትርጉም ቢሰጡትም - በተለያዩ የእንግሊዝኛ አገላለጾች ለየተለያዩ ፍቺዎች። ይህ የሚያመለክተው የቃል አገላለጽ ትርጉም ጥራት ቢያንስ ሁለት ልኬቶች እንዳሉት ነው፦ ሞዴሉ አገላለጹን በጭራሽ ይገነዘበው እንደሆነ፣ እና ከዒላማ ቋንቋው ከሚገኙት አማራጮች ውስጥ የትኛውን ተመጣጣኝ አገላለጽ እንደሚመርጥ ነው። የመደበኛ የትርጉም ጥራት መለኪያዎች እነዚህን ሁለት ልኬቶች በግልጽ አይለያዩም። እኔ እንደማስበው እነሱ ማድረግ አለባቸው።
ይህ ጽሑፍ በMachineTranslation.com's ልማት መድረክ ላይ ባደረገው የውስጥ ሙከራ ላይ የተመሠረተ ነው። ይህ የሚያሳየው ባለብዙ ሞዴል ስሪት ሙከራ ገና ለህዝብ ይፋ አልሆነም። ማሳያውን እያጋራሁት ነው ምክንያቱም ትርጉሞቻችሁን በየትኛውም ቦታ ብታደርጉት ምልከታው ጠቃሚ ነው ብዬ ስላሰብኩ ነው።