ಎಸಿಎಲ್ (ಕಂಪ್ಯೂಟೇಶನಲ್ ಲಿಂಗ್ವಿಸ್ಟಿಕ್ಸ್ ಅಸೋಸಿಯೇಷನ್ ವಾರ್ಷಿಕ ಸಭೆ) 2朮91年四技,ಎಸಿಎಲ್ 2朮91年四技,ಎಸಿಎಲ್ ಕಂಪ್ಯೂಟಿಂಗ್ ಭಾಷಾ ವಿಜ್ಞಾನ ಮತ್ತು ನೈಸರ್ಗಿಕ ಭಾಷಾ ಸಂಸ್ಕರಣೆ (ಎನ್ಎಲ್ಪಿ) ಕ್ಷೇತ್ರದಲ್ಲಿ ಅಂತರರಾಷ್ಟ್ರೀಯ ಉನ್ನತವಾಗಿದೆ, ಇದು ಶೈಕ್ಷಣಿಕ ಕ್ಷೇತ್ರದಲ್ಲಿ ಅತ್ಯಂತ ಪ್ರಭಾವಶಾಲಿಯಾಗಿದೆ. ಕ್ಷೇತ್ರ,汇聊了这样全图全学习界和工业硠硩甶茩
文章解读了被ACLದೊಡ್ಡ ಮಾದರಿ ಮೌಲ್ಯಮಾಪನ, ಸಂಕೀರ್ಣ ಪ್ರಕ್ರಿಯೆ ವಿಶ್ಲೇಷಣೆ, ಸ್ಪರ್ಧೆಯ ಮಟ್ಟದ ಗಣಿತ ಚಿಂತನೆ ಆಪ್ಟಿಮೈಸೇಶನ್, ಮುಂದುವರಿದ ಕಲಿಕೆಯ ಆಪ್ಟಿಮೈಸೇಶನ್, 甏成学 ಆಪ್ಟಿಮೈಸೇಶನ್, ಮುಂದುವರಿದ ಕಲಿಕೆಯ ಆಪ್ಟಿಮೈಸೇಶನ್, ಸ್ಪರ್ಧೆಯ ಮಟ್ಟ电影电影,ಒಟ್ಟಿಗೆ ಕಲಿಕೆಯನ್ನು ವಿನಿಮಯ ಮಾಡಿಕೊಳ್ಳಲು ಎಲ್ಲರಿಗೂ ಸ್ವಾಗತ.
01 ಕೋರ್ಕೋಡ್ಬೆಂಚ್: ರೆಪೊಸಿಟರಿ ಮಟ್ಟದಲ್ಲಿ ಸೂಕ್ಷ್ಮವಾದ ಕಾರ್ಯಗಳ ಮೂಲಕ ಕೋಡ್ ಬುದ್ಧಿಮತ್ತೆಯನ್ನು ಡಿಕೌಪ್ ಮಾಡುವುದು
CoreCodeBench: 线粒度小明级级解解视频电影电影
ಪೇಪರ್ಗಳನ್ನು ಡೌನ್ಲೋಡ್ ಮಾಡಿ(ಪಿಡಿಎಫ್

ಪ್ರಬಂಧ ಪರಿಚಯ: ಈ ಪ್ರಬಂಧವು ಕೋರ್ಕೋಡ್ಬೆಂಚ್ ಅನ್ನು ಪ್ರಸ್ತಾಪಿಸುತ್ತದೆ, ಇದು ದೊಡ್ಡ-ಭಾಷೆಯ ಮಾದರಿ ಪ್ರೋಗ್ರಾಮಿಂಗ್ ಸಾಮರ್ಥ್ಯಕ್ಕಾಗಿ ಒಂದು ರೀತಿಯ ಸೂಕ್ಷ್ಮವಾದ ಮೌಲ್ಯಮಾಪನ ಮಾನದಂಡವಾಗಿದೆ. ಇದು 12 ಪೈಥಾನ್ ಓಪನ್ ಸೋರ್ಸ್ ಲೈಬ್ರರಿಗಳಿಂದ ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಉತ್ಪತ್ತಿಯಾಗುತ್ತದೆ. 1,524 ರಚನಾತ್ಮಕ ಕಾರ್ಯಗಳು, ಅಭಿವೃದ್ಧಿ, ದುರಸ್ತಿ, ಟೆಸ್ಟ್ ಡ್ರೈವ್ ಅಭಿವೃದ್ಧಿ ಇತ್ಯಾದಿಗಳಂತಹ ವಿವಿಧ ಸಾಫ್ಟ್ವೇರ್ ಎಂಜಿನಿಯರಿಂಗ್ ಸನ್ನಿವೇಶಗಳನ್ನು ಒಳಗೊಂಡಿವೆ, ವಿಭಿನ್ನ ಅರಿವಿನ ಹೊರೆಗಳ ನಡುವೆ ಪರಿಣಾಮಕಾರಿಯಾಗಿ ವ್ಯತ್ಯಾಸವನ್ನು ಮತ್ತು ಕಾರ್ಯ ಸಂಕೀರ್ಣತೆಯನ್ನು ಕ್ರಿಯಾತ್ಮಕವಾಗಿ ಹೊಂದಿಸುತ್ತದೆ. ಪ್ರಯೋಗಗಳು ಅದರ ಪರಿಣಾಮಕಾರಿತ್ವವು 78.55% ತಲುಪುತ್ತದೆ ಎಂದು ತೋರಿಸುತ್ತದೆ, ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ವಿಧಾನಗಳಿಗಿಂತ ಗಮನಾರ್ಹವಾಗಿ ಉತ್ತಮವಾಗಿದೆ, ವಿವಿಧ ರೀತಿಯ ಕಾರ್ಯಗಳನ್ನು ಹೊಂದಿಸುವ ಮಾದರಿಯ ಸಾಮರ್ಥ್ಯವನ್ನು ಬಹಿರಂಗಪಡಿಸುತ್ತದೆ.
02 ಎಸ್ಒಪಿ-ಮೇಜ್: ಸಂಕೀರ್ಣ ವ್ಯವಹಾರ ಗುಣಮಟ್ಟದ ಕಾರ್ಯಾಚರಣಾ ಕಾರ್ಯವಿಧಾನಗಳ ದೊಡ್ಡ ಭಾಷೆಯ ಮಾದರಿಗಳನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವುದು
SOP-ಮೇಜ್: ಸಂಕೀರ್ಣ ವ್ಯವಹಾರ ಪ್ರಮಾಣಿತ ಕಾರ್ಯಾಚರಣೆಯ ಹರಿವಿನಲ್ಲಿ ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಯ ಕಾರ್ಯಕ್ಷಮತೆಯ ಮೌಲ್ಯಮಾಪನ
ಪೇಪರ್ಗಳನ್ನು ಡೌನ್ಲೋಡ್ ಮಾಡಿ(ಪಿಡಿಎಫ್

ಪ್ರಬಂಧ ಪರಿಚಯ: ದೊಡ್ಡ ಮಾದರಿಗಳನ್ನು ವಿವಿಧ ಕ್ಷೇತ್ರಗಳಲ್ಲಿ ಬುದ್ಧಿವಂತ ಸಂಸ್ಥೆಗಳಾಗಿ ಹೆಚ್ಚಾಗಿ ಬಳಸಲಾಗುತ್ತಿರುವುದರಿಂದ, ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಮೌಲ್ಯಮಾಪನಗಳು ಸೂಚನೆಗಳನ್ನು ಅನುಸರಿಸುವ ಮತ್ತು ನಿರ್ಧಾರಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳುವ ಸಾಮರ್ಥ್ಯದ ಮೇಲೆ ಕೇಂದ್ರೀಕರಿಸುತ್ತವೆ, ಆದರೆ ನೈಜ ವ್ಯವಹಾರದ ಸನ್ನಿವೇಶಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಸಂಕೀರ್ಣ ಗುಣಮಟ್ಟದ ಕಾರ್ಯಾಚರಣಾ ಕಾರ್ಯವಿಧಾನಗಳನ್ನು (SOP) ಒಳಗೊಂಡಿರುತ್ತವೆ ಮತ್ತು ಸಾಮರ್ಥ್ಯದ ಮೌಲ್ಯಮಾಪನದ ಈ ಅಂಶವು ಸಂಪೂರ್ಣವಾಗಿ ಪರಿಶೋಧಿಸಲ್ಪಟ್ಟಿಲ್ಲ. ಈ ಅಂತರವನ್ನು ತುಂಬಲು, ಸಂಶೋಧಕರು 23 ಸಂಕೀರ್ಣ SOP ಸನ್ನಿವೇಶಗಳು ಮತ್ತು 3422 ಉಪಕಾರ್ಯಗಳಿಂದ 397 ಉದಾಹರಣೆಗಳನ್ನು ಒಳಗೊಂಡಂತೆ ನೈಜ ವ್ಯವಹಾರ ಡೇಟಾವನ್ನು ಆಧರಿಸಿ SOP-ಮೇಜ್ ಅನ್ನು ನಿರ್ಮಿಸಿದ್ದಾರೆ.
ಕಾಗದದ SOP ಕಾರ್ಯ 分成两大类:「择根电视」(LRS) ಅನೇಕ ಆಯ್ಕೆಗಳನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತದೆ, ವ್ಯಾಪಕ ಶ್ರೇಣಿಯ ಕಾರ್ಯಗಳ ನಿಖರವಾದ ಆಯ್ಕೆಯ ಅಗತ್ಯವಿರುತ್ತದೆ.
ಪ್ರಾಯೋಗಿಕ ಫಲಿತಾಂಶಗಳು SOP-ಮೇಜ್ನಲ್ಲಿನ ಬಹುತೇಕ ಎಲ್ಲಾ ಅತ್ಯಾಧುನಿಕ ಮಾದರಿಗಳು 吃力 ತೋರಿಸುತ್ತವೆ.
ಸರಳವಾಗಿ ಹೇಳುವುದಾದರೆ, ಇದು “ವ್ಯಾಪಾರ ಪ್ರಕ್ರಿಯೆಗಳ ಸಂಕೀರ್ಣತೆಯನ್ನು ನಿಜವಾಗಿಯೂ ಪ್ರತಿಬಿಂಬಿಸದ ಮಾದರಿಗಳು,” ಮೇಲೆ ಕೇಂದ್ರೀಕರಿಸಿದ ವಿಮರ್ಶೆಯಾಗಿದೆ ಮತ್ತು ಪ್ರಸ್ತುತ ಮಾದರಿಯು ಈ ವಿಷಯದಲ್ಲಿ ಸ್ಪಷ್ಟ ನ್ಯೂನತೆಗಳನ್ನು ಹೊಂದಿದೆ ಎಂದು ಫಲಿತಾಂಶಗಳು ತೋರಿಸುತ್ತವೆ.
03 AMO-ಬೆಂಚ್: ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಗಳು ಇನ್ನೂ ಪ್ರೌಢಶಾಲಾ ಗಣಿತ ಸ್ಪರ್ಧೆಗಳಲ್ಲಿ ಸ್ಪರ್ಧಿಸುತ್ತವೆ
AMO-ಬೆಂಚ್: ಪ್ರೌಢಶಾಲಾ ಗಣಿತ ಸ್ಪರ್ಧೆಯಲ್ಲಿ ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಯು ಇನ್ನೂ ಸವಾಲುಗಳನ್ನು ಎದುರಿಸುತ್ತಿದೆ
ಪೇಪರ್ಗಳನ್ನು ಡೌನ್ಲೋಡ್ ಮಾಡಿ(ಪಿಡಿಎಫ್

ಪ್ರಬಂಧ ಪರಿಚಯ: ಈ ಲೇಖನವು AMO-ಬೆಂಚ್ ಅನ್ನು ಪ್ರಸ್ತುತಪಡಿಸುತ್ತದೆ, ಅವುಗಳಲ್ಲಿ ಒಂದು 50 ಕಷ್ಟಕರವಾದ ವಿಜ್ಞಾನ ಮಾನದಂಡಗಳನ್ನು ಒಳಗೊಂಡಿದೆ.
- 经安全设计达国际奥数(IMO)或最好难度;
- 完全原创以杜绝ಡೇಟಾ ಮಾಲಿನ್ಯ
- ಅಂತಿಮ ಉತ್ತರ ಮಾತ್ರ ಅಗತ್ಯವಿದೆ, ಸ್ವಯಂಚಾಲಿತ ಮೌಲ್ಯಮಾಪನವನ್ನು ಬೆಂಬಲಿಸಲಾಗುತ್ತದೆ.
ದೊಡ್ಡ ಮಾದರಿಗಳ 26 ಮಾದರಿಗಳ ಮೌಲ್ಯಮಾಪನವು ಅತ್ಯಂತ ಶಕ್ತಿಶಾಲಿ ಮಾದರಿಗಳ ನಿಖರತೆಯ ದರವು ಕೇವಲ 52.4% ಎಂದು ತೋರಿಸುತ್ತದೆ ಮತ್ತು ಅವುಗಳಲ್ಲಿ ಹೆಚ್ಚಿನವು 40% ಕ್ಕಿಂತ ಕಡಿಮೆಯಿದೆ. ಪರೀಕ್ಷಾ ಸಮಯದ ಲೆಕ್ಕಾಚಾರದಲ್ಲಿನ ಹೆಚ್ಚಳವು ಉತ್ತಮ ವಿಸ್ತರಣೆ ಸಾಮರ್ಥ್ಯವನ್ನು ತೋರಿಸುತ್ತದೆಯಾದರೂ, ದೊಡ್ಡ ಮಾದರಿಯ ನಿಖರತೆ ಇನ್ನೂ ದೊಡ್ಡದಾಗಿದೆ.
04 ದಿ ಎವಲ್ಯೂಷನ್ ಆಫ್ ಥಿಂಕಿಂಗ್: ಟ್ರ್ಯಾಕಿಂಗ್ LLM ಓವರ್ಥಿಂಕಿಂಗ್ ಥ್ರೂ ರೀಸನಿಂಗ್ ಡೈನಾಮಿಕ್ಸ್ ಅನಾಲಿಸಿಸ್
电影的进化: 推理ಡೈನಾಮಿಕ್ ವಿಶ್ಲೇಷಣೆಯ ಮೂಲಕ ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಯ ಅತಿಯಾದ ಚಿಂತನೆಯನ್ನು ಪತ್ತೆಹಚ್ಚುತ್ತದೆ
ಪೇಪರ್ಗಳನ್ನು ಡೌನ್ಲೋಡ್ ಮಾಡಿ(ಪಿಡಿಎಫ್

ಪ್ರಬಂಧ ಪರಿಚಯ: 推理中的ಅತಿಯಾದ ಚಿಂತನೆಯ ವಿದ್ಯಮಾನದ ದೀರ್ಘ ಸರಪಳಿಯ ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಯ ಪ್ರಬಂಧ, ಉತ್ತರದ ವಿಶ್ಲೇಷಣೆಯ ಮಾದರಿಯು ಕಾಗದವು ಅನಗತ್ಯ ಆಲೋಚನೆಗಳನ್ನು ಸೃಷ್ಟಿಸುವುದನ್ನು ಮುಂದುವರೆಸಿದ ನಂತರ ರೂಪುಗೊಂಡಿದೆ.
ಈ ವಿದ್ಯಮಾನಗಳ ಆಧಾರದ ಮೇಲೆ, ಪ್ರಬಂಧವು ಉದಾಹರಣೆ-ಮಟ್ಟದ ತಾರ್ಕಿಕ ಪೂರ್ಣಗೊಳಿಸುವಿಕೆ ಪಾಯಿಂಟ್ (RCP) ಅನ್ನು ಮುಂದಿಟ್ಟಿದೆ, ಇದು ಉತ್ತರವನ್ನು ರಚಿಸುವ ಮೊದಲು ಪರಿಣಾಮಕಾರಿ ಹುಡುಕಾಟ ಮತ್ತು ಉತ್ತರವನ್ನು ಸ್ಥಿರಗೊಳಿಸಿದ ನಂತರ ಅನಗತ್ಯ ವಿಸ್ತರಣೆಯ ನಡುವೆ ವ್ಯತ್ಯಾಸವನ್ನು ಗುರುತಿಸಲು ಬಳಸಲಾಗುತ್ತದೆ ಮತ್ತು ಉತ್ತರವನ್ನು ರಚಿಸುವ ಮೊದಲು ಪರಿಣಾಮಕಾರಿ ಹುಡುಕಾಟದ ನಡುವೆ ವ್ಯತ್ಯಾಸವನ್ನು ಗುರುತಿಸಲು ಮತ್ತು ಉತ್ತರವು ಸ್ಥಿರವಾಗಿರುತ್ತದೆ, ಮೂಲತಃ ಮಾದರಿಯ ನಿಖರತೆಯನ್ನು ಕಾಪಾಡಿಕೊಳ್ಳಿ.
05 MASPO: ದೃಢವಾದ LLM ತಾರ್ಕಿಕತೆ ಮತ್ತು ಸಮರ್ಥ ಮಾದರಿಗಾಗಿ ಗ್ರೇಡಿಯಂಟ್ಗಳು, ಸಂಭವನೀಯತೆಯ ದ್ರವ್ಯರಾಶಿ ಮತ್ತು ಸಂಕೇತದ ವಿಶ್ವಾಸಾರ್ಹತೆಯ ಬಳಕೆಯನ್ನು ಏಕೀಕರಿಸುವುದು.
MASPO: ಏಕೀಕೃತ ಪ್ರಮಾಣದ ಬಳಕೆ, ಸಂಭವನೀಯತೆ, ಗುಣಮಟ್ಟ ಮತ್ತು ಸಿಗ್ನಲ್ ವಿಶ್ವಾಸಾರ್ಹತೆ.
ಪೇಪರ್ಗಳನ್ನು ಡೌನ್ಲೋಡ್ ಮಾಡಿ(ಪಿಡಿಎಫ್

ಪ್ರಬಂಧ ಪರಿಚಯ: MASPO ದೊಡ್ಡ ಮಾದರಿಗಳಿಗೆ ತರಬೇತಿ ಆಪ್ಟಿಮೈಸೇಶನ್ ಪ್ರೋಗ್ರಾಂ ಅನ್ನು ಪ್ರಸ್ತಾಪಿಸಿದೆ. ಇದು RLVR (ಪರಿಶೀಲಿಸಬಹುದಾದ ಪ್ರತಿಫಲ) ಸನ್ನಿವೇಶದಲ್ಲಿದೆ ಮತ್ತು ತರಬೇತಿ ಸ್ಥಿರತೆ ಮತ್ತು ಮಾದರಿ ದಕ್ಷತೆಯ ವಿಷಯದಲ್ಲಿ GRPO ನಂತಹ ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ವಿಧಾನಗಳ ನ್ಯೂನತೆಗಳನ್ನು ಪರಿಹರಿಸುವ ಗುರಿಯನ್ನು ಹೊಂದಿದೆ. ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ವಿಧಾನಗಳು ಸ್ಥಿರ ಮತ್ತು ಸಮ್ಮಿತೀಯ ದಕ್ಷತೆಯನ್ನು ಅವಲಂಬಿಸಿವೆ.
ಈ ನಿಟ್ಟಿನಲ್ಲಿ, MASPO ಮೂರು ಪ್ರಮುಖ ಆವಿಷ್ಕಾರಗಳನ್ನು ಮುಂದಿಟ್ಟಿದೆ:
- ಮೃದುವಾದ ಗೌಸಿಯನ್ ಗೇಟ್ 上海硬裁剪,小是最好成度;
- ಮಾಸ್-ಅಡಾಪ್ಟಿವ್ ಲಿಮಿಟರ್ ಟೋಕನ್ ಸಂಭವನೀಯತೆಯ ಡೈನಾಮಿಕ್ ಹೊಂದಾಣಿಕೆ ನಿರ್ಬಂಧದ ಪ್ರಕಾರ ,时间长尾进行;
- ಅಸಮಪಾರ್ಶ್ವದ ಅಪಾಯ ನಿಯಂತ್ರಕ 电影正性性手机手机,电影时间正性手机。
MASPO ಬಹು ಗಣಿತದ ಮಾನದಂಡಗಳು ಮತ್ತು ವಿಭಿನ್ನ ಮಾದರಿಯ ಮಾಪಕಗಳನ್ನು ಆಧರಿಸಿದೆ ಎಂದು ಪ್ರಯೋಗವು ಸಾಬೀತುಪಡಿಸುತ್ತದೆ. ಗುಣಮಟ್ಟಕ್ಕೆ ಹೋಲಿಸಿದರೆ, ಕಾರ್ಯಕ್ಷಮತೆ ಉತ್ತಮವಾಗಿದೆ ಮತ್ತು ವಿಸ್ತರಿಸಬಹುದಾಗಿದೆ.
06 LLM-ಆಧಾರಿತ ಶಿಫಾರಸುಗಳಿಗಾಗಿ ಫ್ಯಾಕ್ಟರೈಸ್ಡ್ ಸುಪ್ತ ರೀಸನಿಂಗ್
ಉತ್ಪಾದಕ ಶಿಫಾರಸಿನ ಆಧಾರದ ಮೇಲೆ
ಪೇಪರ್ಗಳನ್ನು ಡೌನ್ಲೋಡ್ ಮಾಡಿ(ಪಿಡಿಎಫ್

ಪ್ರಬಂಧ ಪರಿಚಯ: ಶಿಫಾರಸು ಕಾರ್ಯಗಳ ಪೀಳಿಗೆಯಲ್ಲಿ, ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಗುಪ್ತ ವಿಧಾನಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಬಳಕೆದಾರರ ಮನಸ್ಸನ್ನು ಪ್ರತಿನಿಧಿಸಲು ಒಂದೇ ಗುಪ್ತ ವೆಕ್ಟರ್ ಅನ್ನು ಬಳಸುತ್ತವೆ, ಇದು ಬಳಕೆದಾರರ ಆದ್ಯತೆಯ ಅಂತರ್ಗತ ಬಹುಆಯಾಮವನ್ನು ಸೆರೆಹಿಡಿಯಲು ಕಷ್ಟವಾಗುತ್ತದೆ.
ಈ ಲೇಖನವು FLR ಅನ್ನು ಮುಂದಿಡುತ್ತದೆ, ಇದನ್ನು ಬಹು ಭಾಷಾ-ಆಧಾರಿತ ಪಕ್ಷಪಾತ ಅಂಶಗಳಾಗಿ ವಿಂಗಡಿಸಲಾಗಿದೆ ಮತ್ತು ಗುಪ್ತ ಚಿಂತನೆಯ ಜಾಗದಲ್ಲಿ ಬೆಳಕಿನ-ಮಟ್ಟದ ಬಹು-ಅಂಶದ ಗಮನ ಮಾಡ್ಯೂಲ್ ಅನ್ನು ಪರಿಚಯಿಸುತ್ತದೆ. ಇದು FLR-GRPO ಅನ್ನು ಮುಂದಿಡುತ್ತದೆ, ಇದು ಸ್ಥಿರವಾದ ಜೋಡಣೆಯನ್ನು ಸಾಧಿಸಲು ಶಬ್ದ ಇಂಜೆಕ್ಷನ್ ಮತ್ತು ನೋ-ಶಬ್ದ ಗುಂಪನ್ನು ಬಳಸುತ್ತದೆ. ಅಮೆಜಾನ್ ಡೇಟಾ ಸೆಟ್ನಲ್ಲಿ, FLR ಸುಪ್ತ ಆಟವು 10.26% ಸೇರಿದಂತೆ 3.2% ವರೆಗೆ ಇದೆ, ಗುಪ್ತ ಭಾಷೆಯನ್ನು ಅರಿತುಕೊಂಡಿದೆ