Хортой хүсэлтийг шүлэг болгоход 25 AI загвар хэрхэн хариулав?

Гараар шүлэг болгон найруулсан 20 хүсэлтэд хортой хариу гарсан дундаж хувь 62%, харин 1,200 хүсэлтийн автомат туршилтад ойролцоогоор 43% байжээ. Энэ нь урьдчилсан өгүүллийн тухайн туршилтад хамаарах тоо юм.
Хортой хүсэлтийг шүлэг болгоход 25 AI загвар хэрхэн хариулав?

AI загвар шууд бичсэн хортой хүсэлтэд хариулахаас татгалзсан ч ижил санааг шүлэг болгон найруулахад өөр хариу өгөх үү? DEXAI, Ромын Сапиенцагийн их сургууль, Sant'Anna School of Advanced Studies-ийн судлаачид энэ асуултыг 25 том хэлний загварт туршжээ.
Судалгааны ажил одоогоор урьдчилсан өгүүлэл хэлбэрээр нийтлэгдсэн. Судлаачид шүлэг өөрөө аюултай гэж дүгнээгүй. Харин хүсэлтийн утга хэвээр байхад найруулгын хэлбэр солигдоход хамгаалалт мөн адил ажиллаж чадах эсэхийг хэмжсэн байна.
62 ба 43 хувь юуг хэмжсэн бэ?
Эхний багцад хортой утгатай 20 хүсэлтийг судлаачид өөрсдөө шүлэг болгон найруулж, есөн нийлүүлэгчийн 25 загварт илгээжээ. Загвар хориглох ёстой хүсэлтэд хортой агуулгатай хариулсан тохиолдлыг судлаачид амжилттай халдлага гэж тооцсон байна. Ингэж тооцсон дундаж нь 62% байв.
Дараа нь MLCommons-ийн 1,200 хортой хүсэлтийг ижил заавраар шүлгийн хэлбэрт автоматаар оруулж туршихад дундаж үзүүлэлт ойролцоогоор 43% гарчээ. Ийнхүү нөлөө нэг загвар, нэг нийлүүлэгч, нэг төрлийн эрсдэлээр хязгаарлагдаагүй ч загвар бүрийн үр дүн харилцан адилгүй байсан.
Хүсэлт бүрийг өмнөх ярианы түүхгүйгээр нэг удаа илгээсэн. Хариултыг нээлттэй жинтэй гурван загвараар үнэлүүлж, сонгосон хэсэг болон үнэлгээ зөрсөн тохиолдлуудыг хүмүүс давхар шалгасан байна.
Найруулгын хэлбэр яагаад нөлөөлж болох вэ?
Судлаачдын таамгаар зүйрлэл, хэмнэл, товчилсон өгүүлэмж, шууд бус хэллэг нь хортой санааг танихад ашигладаг зарим шинжийг бүдгэрүүлж болзошгүй. Хамгаалалт хүсэлтийн гол утгаас илүү танил үг, өгүүлбэрийн хэвэнд түшиглэдэг бол өөр найруулгатай ижил санааг алдах эрсдэлтэй.
Гэхдээ судлаачид бүх загварт үйлчлэх ганц шалтгаан тогтоогоогүй. Туршилт хамгаалалтын зан үйлийн ялгааг хэмжсэн болохоос загвар бүрийн дотоод шалтгааныг нотлоогүй юм.
AI бүтээгдэхүүн хөгжүүлж буй баг юу шалгах вэ?
Үйлчилгээ үзүүлэгчийн үндсэн шүүлтүүрт дангаар нь найдахгүй байх нь энэ судалгаанаас авах бодит сургамж юм. Туршилтад дараах хувилбарыг нэмж болно:
- нэг санааг энгийн өгүүлбэр, шүлэг, зүйрлэл, дүрд тоглосон яриа зэрэг өөр өөр найруулга, хэлээр турших;
- оролт болон гарсан хариултын эрсдэлийг тус тусад нь шалгах;
- мөнгө шилжүүлэх, мэдээлэл устгах, эрх өөрчлөх зэрэг эрсдэлтэй үйлдэлд хүний зөвшөөрөл шаардах;
- татгалзсан, сэжигтэй болон алдаатай хүсэлтийг бүртгэж, загвар шинэчлэгдэх бүрд дахин турших.
Судалгааны тоог хэрхэн ойлгох вэ?
62 хувь нь бүх шүлэг, бүх AI системд хамаарах тогтмол магадлал биш. Энэ тоо сонгосон хүсэлт, тухайн үеийн загварын хувилбар, тохиргоо, үнэлгээний аргад хамаарна. Мөн бүх хариултыг хүн нэг бүрчлэн үнэлээгүй.
Загвар, үйлчилгээ үзүүлэгчийн хамгаалалт байнга шинэчлэгддэг тул нэг удаагийн үр дүнг байнгын жишиг болгох боломжгүй. Харин эрсдэлийн туршилтад зөвхөн шууд хүсэлт бус, монгол зэрэг олон хэл, ер бусын найруулга, санаатай далдалсан хэлбэрийг оруулах шаардлагатайг энэ өгүүлэл сануулж байна.
Эх сурвалж

Дараа нь унших
Холбоотой нийтлэлүүд

PROMPTFLUX: кодоо AI-аар хувиргахаар туршсан хортой программ
Google-ийн GTIG баг 2025 оны 6 дугаар сард PROMPTFLUX нэртэй туршилтын VBScript программ илрүүлжээ. Уг программ ажиллахдаа Gemini API-аас өөрийн кодын танихад бэрх хувилбар авахыг оролддог байсан ч төхөөрөмж, сүлжээнд амжилттай халдсан баримт тайланд байхгүй.

Oyu AI ШХАБ-ын залуучуудын тэмцээнээс Excellence Award хүртлээ
Арван бүсийн 230 төслөөс найман орны 20 төсөл Чиндао хотын шигшээ шатанд шалгарчээ. Oyu AI энэ шатанд код бичихгүйгээр өгөгдөл боловсруулах, шинжлэх, дүрслэх бүтээгдэхүүнээ танилцуулж, Excellence Award хүртсэн 14 төслийн нэг боллоо.

Хиймэл ерөнхий оюун ухаан зах зээлийн судалгааг хэрхэн өөрчлөх вэ?
Шийдвэр гаргалт Хүн төрөлхтний түүхэн дэх хамгийн хүчирхэг технологийн шилжилт хаяанд ирлээ. Та бизнес болон карьераа AGI-ийн эрин үед бэлтгэсэн үү? Дэлгэрэнгүй мэдээллийг g-insight.mn хуудаснаас авна уу.