July 10, 2026
ორი სიტყვა. ექვსი მოდელი. სამი განსხვავებული თარგმნის გადაწყვეტილება. აი რა მოხდა, როდესაც 8 ტესტის წინადადება გავუშვი უახლესი AI მოდელების მეშვეობით, რომლებიც ხელმისაწვდომია MachineTranslation.com-ზე, და რა ამჟამად ავლენს სინამდვილეში მოდელის მუშაობის შესახებ, როდესაც ის ჩუმად ვერ ხერხდება.
ორი სიტყვა. "ეს საშინელია." ექვსი მოდელი. სამი განსხვავებული თარგმნის გადაწყვეტილება.
იაპონურში, ერთმა მოდელმა ის ასე გადაიტანა それはやばい, შეინარჩუნა გაურკვევლობა. კიდევ ერთმა მთლიანად გამოტოვა საგნის ნაცვალსახელი და დაწერა უშუფ ფორმა やばい, ყველაზე კოლოკვიალური ვერსია შესაძლო. მესამე ადამიანი დაწერა それはすごい, რომელიც სრულიად გაწმენდის ორაზროვანობას "საოცრის" სასარგებლოდ, აშორებს ორმაგ მნიშვნელობას, რომელიც ფრაზას საინტერესო ხდიდა. ვიეტნამურში, ერთმა მოდელმა დაწერა Đỉnh vậy (სლენგი, სწორი ახალგაზრდული რეგისტრისთვის). კიდევ ერთმა დაწერა ეს ნამდვილად მშვენიერია, გრამატიკულად სწორი, მაგრამ უფრო ახლოს ის ნიშნავს "ეს ნამდვილად საოცარია" როდესაც ვინმე გიგზავნით მემს.
ეს ყველა დასაცავი არის. მათ შორის არცერთი არ არის ერთი და იგივე რამ. და თუ თქვენ ტარდებით თარგმნებს ერთი მოდელის მეშვეობით, თქვენ არასოდეს დაინახავთ არჩევანს, რომელიც თქვენი სახელით გაკეთდა.
ეს არის ცენტრალური კითხვა, რომელსაც ეს სტატია ცდილობს პასუხის გაცემას. არა რომელი AI მოდელი საუკეთესოა თარგმნისთვის 2026 წელს (პასუხი დამოკიდებულია ენის წყვილზე, რეგისტრზე, დომენზე და წინადადების სტრუქტურაზე), არამედ: როგორ იცოდით, როდესაც თქვენი მოდელმა არასწორი გადაწყვეტილება მიიღო? განსაკუთრებით ისეთ დომენებში, როგორიცაა სამედიცინო ტერმინოლოგია, იურიდიული ხელშეკრულებები ან პროფესიონალური ფორმალობა, სადაც არასწორი გადაწყვეტილება ზუსტად ისე გამოიყურება, როგორც სწორი თარგმანი, სანამ სპეციალისტი არ წაიკითხავს.
აი რა გავაკეთე. მე 8 ტესტის წინადადება გავუშვი MachineTranslation.com-ის ორი რაუნდის მოდელებში: პირველი იყო 5 ფართოდ გამოყენებული მოდელის საბაზო ვერსია, შემდეგ გაფართოებული ჯგუფი, რომელიც დაამატებს ახალი პრემიუმ-ტიერის მოდელის რამდენიმე ვარიანტს, რომელიც ახლა ხელმისაწვდომია გადახდის მომხმარებლებისთვის. ჩვეულებრივად, ასეთი მოდელების გამოშვების შედარება ნიშნავდა ცალკეული გადახდილი გამოწერების ქონას თითოეული პროვაიდერთან ცალ-ცალკე. MachineTranslation.com-ზე ისინი ერთსა და იმავე შედარების ხედში იჯდებიან. ენის წყვილი იყო ინგლისური→იაპონური და ინგლისური→ვიეტნამური. წინადადების კატეგორიები სპეციალურად შეირჩა სტრესის ტესტირებისთვის იმ ადგილებში, სადაც მოდელის უთანხმოება ყველაზე მნიშვნელოვანია: იდიომატური ფრაზირება, იურიდიული ტერმინოლოგია, სამედიცინო ტერმინოლოგია, ფორმალობის მიმართ მგრძნობიარე კონტექსტი და განზრახ სემანტიკური ბუნდოვანება.
შენიშვნა შეფასების მეთოდოლოგიის შესახებ: მანქანური თარგმნის კვლევამ დიდი ხნის განმავლობაში ბრძოლა გაწია იმაზე, თუ როგორ შეფასდეს გამოშვებული ინფორმაცია ავტომატურად. მეტრიკები, როგორიცაა BLEU და COMET , რომელიც გაზომილია WMT საერთო ამოცანებში , აძლევს სასარგებლო კრებითი სიგნალს, მაგრამ ისინი ცუდად ამოიცნობენ რეგისტრის შეცდომებს, იდიომის უკმარობებს და ტერმინოლოგიური სიზუსტეს, ზუსტად იმ კატეგორიებს, რომლებიც აქ ყველაზე მნიშვნელოვანია. რაც თქვენ ახლა წაიკითხავთ არის გამომავალი ანალიზი, არა BLEU რეიტინგი.

ყველა წინადადება არ ზედაპირი აქვს მნიშვნელოვან უთანხმოებას. ოთხი ტესტიდან ორი, "მოდი, დავუკავშირდეთ ერთმანეთს, როდესაც ეს გარიგება დამშვიდდება" (→ იაპონური) და "ჩვენ ღამის შუაღამეს ვმუშაობთ ამ გაშვების თარიღის დასაკმაყოფილებლად" (→ ვიეტნამური), აჩვენა მაღალი თანხმობა ორივე რაუნდში. იდიომები სწორად გაიგეს იდიომებად. არავის არ თარგმნა "touch base" როგორც ფიზიკური ბაზის შეხება. არავის თარგმნა "the dust settles" ნალექად ან ნიჟარად.
ეს ღირს გაჩერებას: იდიომატური ინგლისური ბიზნეს ენა საკმაოდ კარგად არის დამუშავებული მიმდინარე ფრონტიერის მოდელების მიერ, როდესაც იდიომა საკმაოდ გავრცელებულია. "touch base" ის კონსენსუსი სტაბილური დარჩა ორივე რაუნდში; ვარიაცია იყო წმინდად სტილისტური, იმის გარშემო, თუ გამოიყენებდა თუ არა この件 (ეს საკითხი), この取引 (ეს გარიგება), ან この案件 (ეს შემთხვევა) წყაროს ფრაზისთვის.

ტესტი "შუაღამის ზეთის წვა" არის ის ადგილი, სადაც საქმე უფრო საინტერესო გახდა. ყველა მოდელი გარდა ერთისა სწორად გაიგო იდიომა. MiniMax M2.7, რაუნდ 2-ში წარმოდგენილი, "burning" სიტყვასიტყვით თარგმნა, რის შედეგადაც მიიღო đốt đuốc, რაც ნიშნავს "აგრძელებული ნაპირები". კონსენსუსი სწორად გამოირიცხა იგი.

იაპონური არის ფორმალობის შრეებიანი ენა. ზმნის დასასრულის, ნაცვალსახელის და რეფერენციული სახელის ფორმის არჩევანი არ არის სტილისტური. ის სიგნალიზებს მოსაუბის პირსა და მიმღებს შორის ურთიერთობას. თქვენი აღმზიდელი დირექტორის მიერ კაზუალური ზმნის ფორმების გამოყენებით შეტყობინების გაგზავნა გრამატიკული თვალსაზრისით თარგმნის შეცდომა არ არის. ეს არის სოციალური შეცდომა, და მნიშვნელოვანი.
შეგიძლიათ ეს გამომიგზავნოთ? მადლობა, ძალიან ვაფასებ. კონტექსტი: CEO-ს წერილობით კომუნიკაცია.

კონსენსუსი შეიცვალა მოდელის პულის გაფართოებისას. მექანიზმი მარტივია: მოდელების დამატება, რომლებიც სწორად კითხულობენ ფორმალობის კონტექსტს, უმრავლესობა გადაიტანა, და კონსენსუსი მოჰყვა. აქ არის სრული სპექტრი იმისა, რაც მოდელებმა გამოიმუშავეს მე-2 რაუნდში:

ვიეტნამური რეგისტრის ტესტმა გამოავლინა ფორმალობის შეცდომის განსხვავებული სახე, რომელიც უფრო დახვეწილია. საწყისი წინადადება: "Hey, სწრაფი კითხვა — თავისუფალი ხარ ზარის აღებისთვის?" კონტექსტი: შეტყობინების გაგზავნა კლიენტისთვის. პირველ რაუნდში Qwen-მა შეიცავდა "mình"-ს, პირველი პირის ნაცვალსახელი, რომელიც გულისხმობს უბრალო თანატოლი დონის მეგობრობას. ყველა სხვა მოდელი სრულად თავს იკავებდა პირველი პირის თვითმითითებისგან, რაც უფრო უსაფრთხო პროფესიონალური არჩევანია. მნიშვნელოვნად, Qwen-მა ეს გამოასწორა მე-2 რაუნდში და გამოტოვა "mình." ორივე რაუნდში კონსენსუსმა იგი გამოირიცხა.

გამყიდველი/კლიენტის ანაზღაურების წინადადება სტანდარტული პუნქტია კომერციულ ხელშეკრულებებში: "გამყიდველი ვალდებულია დაიცვას კლიენტი ნებისმიერი მესამე მხარის მოთხოვნებისგან, რომელიც წარმოიქმნება ამ ხელშეკრულების დარღვევიდან."
რაუნდში 1, ყველა ხუთმა მოდელმა სწორად ამოიცნო იურიდიული რეგისტრი და გამოიყენა ნასესხები სიტყვები ベンダー (მომწოდებელი) და クライアント (კლიენტი), რომლებიც სტანდარტულია ინგლისური წარმოშობის იაპონურ კომერციულ ხელშეკრულებებში. ერთი გამონაკლისი: GPT-4.1-NANO გამოიყენა 販売者 (seller) და 顧客 (customer), ლეგიტიმური იაპონური სიტყვები, რომლებიც მოკლებული არიან სესხული სიტყვების ფორმალური იურიდიული სპეციფიკურობას.
უფრო მნიშვნელოვანი აღმოჩენა მეორე რაუნდში გამოჩნდა. მთავარი განსხვავება ორ სიტყვას შორის:
ეს იურიდიულად განსხვავებული კონცეფციებია. "Indemnify" კონკრეტულად ნიშნავს მესამე მხარის პასუხისმგებლობისგან პარტიის დაცვას. 免責 არის სწორი იურიდიული ტერმინი. ყველა Round 1 მოდელი გამოიყენა 補償. მე-2 რაუნდში, DeepSeek V4-Pro იყო ერთადერთი მოდელი, რომელმაც წარმოქმნა 免責, და მან ეს მე-2 რაუნდში გააკეთა, არა მე-1 რაუნდში.

ხელშეკრულებაში, 補償 და 免責 არ არის სინონიმები. ერთი ნიშნავს "ჩვენ დაგანაზღაურებთ." მეორე ნიშნავს "თქვენ დაცულები ხართ მტკიცებულებისგან თავიდან". თუ თარგმანის პლატფორმა იყენებს 補償-ს, სადაც 免責 სწორია, იურისტი, რომელიც იაპონური ვერსიის კითხვას ცდილობს, არ დაინახავს იმავე ხელშეკრულებას, რომელსაც ინგლისური ვერსია აღწერს.
ეს არის ყველაზე მნიშვნელოვანი აღმოჩენა მონაცემთა ბაზაში. სატესტო წინადადება: "ეს მედიკამენტი უკუნაჩვენებული არის პაციენტებში, რომელთაც აქვთ ღვიძლის დაზიანების ისტორია." Source: კლინიკური პროდუქტის დოკუმენტაცია. სამიზნე: ვიეტნამური.
კრიტიკული ტერმინი არის "ღვიძლის უკმარობა." არის ორი ვიეტნამელი კანდიდატი:
ეს კლინიკურად განსხვავებული არის. "ღვინის უკუჩვენება" ბაზაზე დაფუძნებული გაფრთხოების შესახებ, რომელიც დაკავშირებულია "ღვინის დაზიანებასთან", ეხება ყველას, ვისაც აქვს შემცირებული ღვინის ფუნქცია, არა მხოლოდ მათ, ვინც განიცადა სრული ორგანოს უკმარობა. სუი განის გამოყენება არასწორად ზღუდავს მითითებულ პოპულაციას. საშუალო სიმძიმის ღვიძლის დაზიანების მქონე პაციენტმა, რომელიც კითხულობს suy gan-ს, შესაძლოა ვერ იცნოს საკუთარი თავი, როგორც უკუნაჩვენები პოპულაცია.

ზოგიერთი წყაროს წინადადება განზომილებით გაურკვეველია. "That's sick" თანამედროვე ინგლისური სლენგში ნიშნავს რაღაც შესანიშნავს, მაგრამ ის ასევე შენარჩუნებს თავის სიტყვიერ მნიშვნელობას (ანუ რაღაც საშინელი/მიზანშეუწონელი), და ამ ორი მნიშვნელობის შორის დაძაბულობა არის ის, თუ როგორ ზეწოდება ფრაზა კომუნიკაციას. თარგმანის მოდელის გამოწვევა ის არის: შენ ინარჩუნებ ორაზროვნებას, ის ჩამოიყვანო ყველაზე სავარაუდო მნიშვნელობამდე, თუ ერთი აირჩიო და ის დაამტკიცო?


ამ ტესტში მოდელები ყველა ეკვივალენტური არ არის. ისინი მოიცავს სხვადსხვა არქიტექტურებს, প্রশিক্ষণ რেჟიმებს და განლაგების კონტექსტებს. პირველი რაუნდის საბაზო ხაზი მოიცავს მოდელებს, რომლებიც ფართოდ ხელმისაწვდომია. გაფართოებული მეორე რაუნდის პული დამატებით მოიცავს რამდენიმე უახლეს პრემიუმ-ტიერის მოდელის ვარიანტებს, რომლებიც ახლა ხელმისაწვდომია გადახდილი მომხმარებლებისთვის MachineTranslation.com-ზე, იგივე ტიერის მოდელი, რომელიც სხვაგვარად ნიშნავდა ცალკე გადახდილ ანგარიშს თითოეული ინდივიდუალური პროვაიდერთან.

მეორე რაუნდის გაფართოებული პული მოიცავს მოდელებს, რომლებიც უფრო მოწინავე და ხელმისაწვდომი გადახდილი მომხმარებლებისთვის MachineTranslation.com-ზე. გაფართოებული ფონდის ეფექტი ერთნაირი არ არის. ზოგიერთ ტესტში (ფორმალურობა/იაპონური), ის კონსენსუსს მნიშვნელოვნად შეცვალა. სხვებში (სამედიცინო ტერმინოლოგია/ვიეტნამური), გაყოფა გაღრმავდა.

ტესტის მონაცემები მიუთითებს ორ განსხვავებულ უკმარობის კატეგორიაზე და მათ სხვადსხვა რეაგირება სჭირდება.
კატეგორია A: ჩsilent failures. ფორმალური შეცდომები, რეგისტრის შეცდომები, სამედიცინო ტერმინოლოგიის სიზუსტე: ეს აწარმოებს გამოთავისებულ შედეგებს. იაპონური გრამატიკულად სწორია. ვიეტნამელი თავისუფლად ლაპარაკობს. არ არის ზედაპირული ნიშანი, რომ რაიმე არ წარმატდა. ერთენოვანი მომხმარებელი, რომელიც კითხულობს ერთი მოდელის გამოსავალს, არ აქვს საშუალება იცოდეს, რომ მოდელმა აირჩია რეგისტრი, რომელიც უფროსი იაპონური აღმზიდელი შენიშვავდა, ან რომ კლინიკური ტერმინი შევიწროვდა ისე, რომ შეცვალა მოსახლეობა, რომელზეც იგი ვრცელდება.
კატეგორია B: ხილული წარუმატებლობები. MiniMax თარგმნის "burning the midnight oil" როგორც "burning torches." GPT-4.1-NANO "That's sick"-ის "すごい"-ზე გადაჭრა. ეს გამოვლენადია, ან მიზნის ენის მოლაპარაკე ადამიანის მიერ, ან სხვა მოდელის გამოშვებებთან შედარებით.
მულტი-მოდელის შედარება, რომელსაც SMART უზრუნველყოფს, ყველაზე ღირებული კატეგორია A-ში. როდესაც ხუთი ან ათი მოდელი აწარმოებს გამოშვებებს და უმეტესობა ეთანხმება ფორმალურ რეგისტრზე, ხოლო ერთი აწარმოებს კაზუალურ უბრალო ფორმის იაპონურს, უთანხმოება ხილული ხდება შედარების ხედვაში. სამიზო ენას მომხმარებელი შეუძლია შეაფასოს ვარიანტები. მომხმარებელმა, რომელიც ვერ ხედავს, რომ დაკამათებული გადაწყვეტილება იქნა მიღებული, შეიძლება გადაწყვიტოს, ითხოვს თუ არა ეს приговор ადამიანური გადახედვას.
დოკუმენტის მასშტაბის სამუშაოსთვის, დიდი ფაილები, PDF-ების, ხელშეკრულებების ან კლინიკური მასალების განლაგების შენარჩუნებული თარგმნა, პლატფორმის დოკუმენტის დამუშავების შესაძლებლობა ფაილის სტრუქტურას სამართავს ფორმატირების დაზიანების გარეშე. მაგრამ ზემოთ დასმული ხარისხის კითხვები ვრცელდება ფაილის ზომის მიუხედავად. 100-გვერდიანი კლინიკური კვლევა, სადაც "ღვიძლის დაზიანება" ყოველი შემთხვევა თარგმნილია როგორც "ღვიძლის უკმარისობა", არის იგივე პრობლემის უფრო დიდი ვერსია, რომელიც გამოვლინდა ტესტ 2-ში.
სამედიცინო და იურიდიული კატეგორიებისთვის კონკრეტულად, ადამიანის გადამოწმება სწორი ზღვარი არის. Tomedes-ის AI-ის შემდგომი რედაქტირების სერვისი, რომელიც აერთიანებს AI-ის გამოტანას სერტიფიცირებული ადამიანის მიმოხილვასთან ზუსტად ამ ტიპის მაღალი რისკის კონტენტისთვის, ამისთვის აგებულია. სუი გან / სუი გიამ ფუნქციონალობა გან გაყოფა არის ზუსტად ის ტიპის აღმოჩენა, რომელიც უნდა გამოწვევდეს ამ მიმოხილვას, არა იმიტომ, რომ ყველა მოდელი არასწორია, არამედ იმიტომ, რომ მოდელები, რომლებიც ყველაზე დარწმუნებული არიან, არ არიან ყველაზე ზუსტი.
მრავალი გამოსავლის ხილვის ღირებულება არ არის ის, რომ თქვენ ყოველთვის აირჩევთ უმრავლესობას. ეს ის არის, რომ თქვენ იცოდით, რომ არჩევანი გაკეთდა, რაც განსხვავდება იმ ვარაუდისგან, რომ თქვენს წინ არსებული შედეგი სწორია.

რვა ტესტი გვერდიგვერდ დააწყე და ნიმუში იშლება: თანხმობა და უთანხმოება არ არის შემთხვევით განაწილებული. იდიომატური, ყოველდღიური ბიზნეს ენა ("კონტაქტში შედგომა", "შუაღამის ზეთი დაწვა") თითქმის ყველა მოდელში შეთავსდა, ორივე რაუნდში. ფორმალობა, იურიდიული სიზუსტე და სამედიცინო ტერმინოლოგია არ იყო. მხოლოდ გაფართოებული ჯგუფის ჩართვის შემდეგ CEO-ის ფორმალურობის ტესტი ერთხელ კაზუალურიდან ფორმალურზე გადავიდა. ინდემნიფიკაციის პუნქტი გამოავლინა რეალური იურიდიული განსხვავება (免責 vs. 補償), რომელიც მხოლოდ ერთმა მოდელმა, ერთ რაუნდში, სწორად გაიგო. სამედიცინო ტერმინოლოგიის დაყოფა საერთოდ არასოდეს გადაწყდა, ორივე რაუნდში დაახლოებით 6-დან-4-მდე დარჩა, მიუხედავად იმისა, რომელი მოდელები იყვნენ ჯამში.
ეს არის რეალური აღმოჩენა, არა მარკეტინგული მტკიცება: კონსენსუსი არ აკეთებს ყველა წინადადებას უკეთეს, და ამის საჭიროება არ არის. ეს ყველაზე ღირებული არის ზუსტად იქ, სადაც ერთი მოდელის თავისუფლება არ გაძლევთ მიზეზს მასში ეჭვი შეიტანოთ, და სადაც ცდომილება რეალურად რაღაცას ღირს.
ამ ტესტის მეორე, უფრო პრაქტიკული ფენა ღირს სიცხადით განცხადება. ამ შედარების ჩატარება თავად ნიშნავდა GPT-5.5, Claude Opus 4-7, Gemini 3.5-Flash, GLM-5-Turbo და MiniMax M2.7-ის გამოშვებების შემოწმებას ერთმანეთის გვერდით არსებული საბაზო მოდელებთან, ერთ ადგილას, ერთ პლატფორმაზე. MachineTranslation.com-ის გარეთ, ეს არ არის ერთი გამოწერა. ეს რამდენიმეა, თითოეული იმ პროვაიდერისთვის, რომლის პრემიუმ ტიერი გსურთ გამოცადოთ, რაც თითოეული პროვაიდერი ინდივიდუალურად აკრეფს. გადახდილი მომხმარებლები აქ იღებენ იგივე შედარებას ერთი დაწკაპუნებით, ხუთი ცალკე პრემიუმ გამოწერის შენარჩუნების ღირებულების წილადში, ყოველი რამის დაკარგვის გარეშე, რომელიც რეალურად მნიშვნელოვანია: იხილოთ სად ეთანხმებიან მოდელები და იცოდეთ ზუსტად როდის არ ეთანხმებიან.
არცერთი კატეგორიულად უკეთესი არ არის; ეს დამოკიდებულია ტესტის კატეგორიაზე. Claude Sonnet და Claude Opus თანმიმდევრულად ირჩევდნენ უფრო ზუსტ ვიეტნამური სამედицინო ტერმინს, ხოლო Claude Opus წარმოქმნიდა ყველაზე შესაფერი სლენგს "That's sick"-ისთვის. მაგრამ Claude Sonnet ასევე წარმოქმნიდა უფორმო იაპონურს ფორმალური CEO-ის კონტექსტის წინადადებაში, სადაც GPT-5.5 სწორად გაიგო. გამომავალი პირდაპირ შედარება უფრო დამცველი ხასიათის აქვს, ვიდრე ერთი მოდელის არჩევა და მის ნდობა.
არ არსებობს ერთი; სიზუსტე დომენზე დამოკიდებულია. Gemini 3.5-Flash და GLM-5-Turbo წარმოქმნეს ყველაზე შესაფერი ფორმალური იაპონური ენა ამ ტესტში. ორივე Claude მოდელი ყველაზე ზუსტი იყო ვიეტნამური სამედიცინო ტერმინოლოგიაში. DeepSeek V4-Pro იყო ერთადერთი მოდელი, რომელმაც გამოიყენა სწორი იაპონური იურიდიული ტერმინი, მაგრამ მხოლოდ მე-2 რაუნდში, და ის აწარმოებდა არაფორმალურ იაპონურს სხვა ადგილებში. არცერთი მოდელი არ დომინირებდა ყველა რვა ტესტში.
არა, არა ავტომატურად. ახალი პრემიუმ-კლასის მოდელის ვარიანტებით აუზის გაფართოება იაპონური ფორმალურობის ტესტში კონსენსუსს არაფორმალურიდან ფორმალურზე გადაიტანა. მაგრამ ვიეტნამური სამედიცინო ტერმინოლოგიის ტესტში, დაყოფა დარჩა დაახლოებით 6-დან-4-ის თანაფარდობით, მიუხედავად იმისა, რომელი მოდელები იყო შეტანილი. მეტი მოდელი გამოავლენს მეტ უთანხმოებას, რაც სასარგებლო სიგნალია, მაგრამ კონსენსუსი მაინც მიჰყვება უმრავლესობას, და უმრავლესობა ყოველთვის ყველაზე ზუსტი პასუხი არ არის.
SMART არის MachineTranslation.com-ის მულტი-მოდელის კონსენსუსის სისტემა, რომელიც მოიცავს 22-მდე AI მოდელს მომწოდებლებისგან, მათ შორის OpenAI, Anthropic, Google და DeepSeek. ის ხელმისაწვდომელი სხვადსხვა მოდელების მეშვეობით თარგმნის ერთდროულად და წარმოადგენს უმრავლესობის კონსენსუსის შედეგს თითოეული მოდელის პასუხის გვერდით, ნაგულისხმევად, რომელიმე კონფიგურაციის გარეშე. კონსენსუსი იცვლება, როდესაც მოდელის ჯამი იცვლება, როგორც ეს ტესტის იაპონური ფორმალურობის შედეგში ჩანს: არაფორმალური კონსენსუსი პირველ რაუნდში გახდა ფორმალური მეორე რაუნდში.
ერთი მოდელი არ არსებობს; ადამიანის მიერ განხილვა უკეთესი პასუხია. Claude მოდელები თანმიმდევრობით ირჩევდნენ უფრო ზუსტ ვიეტნამური სამედიცინო ტერმინს, ხოლო მხოლოდ DeepSeek V4-Pro გამოიყენა სწორი იაპონური იურიდიული ტერმინი, მაგრამ მხოლოდ მე-2 რაუნდში. სამედიცინო ტერმინოლოგიის დაყოფა არ გადაწყდა 10 მოდელში, რაც მიუთითებს იმაზე, რომ საჭიროა დომენის ექსპერტიზა, არა ის, რომ სხვა მოდელი უნდა აირჩეს. A სერტიფიცირებული ადამიანის შემდგომი რედაქტირების მიმოხილვა, როგორც Tomedes გთავაზობს, უზრუნველყოფს ამ სპეციალისტის შემოწმებას.