ASX (Agentic System X) ತಂಡವು ದೊಡ್ಡ-ಪ್ರಮಾಣದ ಮಾದರಿ-ಆಧಾರಿತ ಏಜೆಂಟ್ ತಂತ್ರಜ್ಞಾನ ವ್ಯವಸ್ಥೆಯನ್ನು ನಿರ್ಮಿಸುವುದರ ಮೇಲೆ ಕೇಂದ್ರೀಕರಿಸುತ್ತದೆ ಮತ್ತು ದೊಡ್ಡ-ಪ್ರಮಾಣದ ಮಾದರಿ ತರಬೇತಿ, ಏಜೆಂಟ್ ತರಬೇತಿ ಮತ್ತು ಬಹು-ಮಾದರಿ ತಿಳುವಳಿಕೆಯ ನಂತರ, ಪ್ರಮುಖ ಮುಂಚೂಣಿಯ ನಿರ್ದೇಶನವು ಆಳವಾಗುವುದನ್ನು ಮುಂದುವರೆಸಿದೆ ಮತ್ತು ICLR, NeurIPS ಮತ್ತು CVPR ನಲ್ಲಿ ಡಜನ್ಗಟ್ಟಲೆ ಉನ್ನತ-ಗುಣಮಟ್ಟದ ಸಂಶೋಧನಾ ಫಲಿತಾಂಶಗಳನ್ನು ಪ್ರಕಟಿಸಿದೆ.
01 ಬಂಡಿ ಬಲವರ್ಧಿತ ಕಲಿಕೆ ಮತ್ತು ಪರಿಶೀಲಿಸಬಹುದಾದ ಪ್ರತಿಫಲಗಳಿಗಾಗಿ ಸಂದರ್ಭವನ್ನು ನಿಯೋಜಿಸುತ್ತದೆ
ಸಂದರ್ಭ
ಪ್ರಬಂಧ ಡೌನ್ಲೋಡ್: PDF

ಪ್ರಬಂಧದ ಪರಿಚಯ: ಕಲಿಕೆಯ ಬಲವರ್ಧನೆಗಾಗಿ ಪ್ರತಿಫಲದ ನಿಯಮಗಳ ಆಧಾರದ ಮೇಲೆ ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ತರಬೇತಿಯನ್ನು ಸಾಮಾನ್ಯವಾಗಿ ಕೊನೆಯ ಸುತ್ತಿನಲ್ಲಿ ತಂತ್ರದ ಆಪ್ಟಿಮೈಸೇಶನ್ ಅನ್ನು ಕೈಗೊಳ್ಳಲು ನೇರವಾಗಿ ಬಳಸಲಾಗುತ್ತದೆ, ಅವುಗಳಲ್ಲಿ ಕಡಿಮೆ-ಗುಣಮಟ್ಟದ ಮಾದರಿಗಳು ಶಬ್ದವನ್ನು ಪರಿಚಯಿಸುತ್ತವೆ, ಉತ್ತಮ-ಗುಣಮಟ್ಟದ ಮಾದರಿಗಳನ್ನು ಒಮ್ಮೆ ಬಳಸಿದ ನಂತರ ತಿರಸ್ಕರಿಸಲಾಗುತ್ತದೆ, ಇದು ಅಸ್ಥಿರ ತರಬೇತಿ ಮತ್ತು ಸಾಕಷ್ಟು ಮಾದರಿ ಬಳಕೆಗೆ ಕಾರಣವಾಗುತ್ತದೆ. ಮಾದರಿ ಆಯ್ಕೆಯು ಸಮಸ್ಯೆಯ ಸಂದರ್ಭದಲ್ಲಿ ಮಾದರಿಯಾಗಿದೆ, ಪ್ರತಿ ಅಭ್ಯರ್ಥಿ ಮಾದರಿಯನ್ನು ತೋಳು ಎಂದು ಪರಿಗಣಿಸಲಾಗುತ್ತದೆ ಮತ್ತು ತರಬೇತಿಯ ನಂತರ ಕಾರ್ಯಕ್ಷಮತೆಯ ಲಾಭವನ್ನು ನೀಡಲಾಗುತ್ತದೆ; ಮಾದರಿಯ ಮೌಲ್ಯವನ್ನು ಬೆಳಕಿನ ನರಮಂಡಲದ ಮೂಲಕ ಊಹಿಸಲಾಗಿದೆ ಮತ್ತು ಆನ್ಲೈನ್ ಪ್ರತಿಕ್ರಿಯೆ ಡೈನಾಮಿಕ್ ಹೊಂದಾಣಿಕೆಯೊಂದಿಗೆ ಸಂಯೋಜಿಸಲಾಗಿದೆ. CBS ಅನ್ನು ವಿವಿಧ ಆಪ್ಟಿಮೈಸೇಶನ್ ತಂತ್ರಗಳು ಮತ್ತು ವಿಧಾನಗಳೊಂದಿಗೆ ಸಂಯೋಜಿಸಬಹುದೆಂದು ಪ್ರಯೋಗಗಳು ತೋರಿಸುತ್ತವೆ. 6 个数学推理ಡೇಟಾಸೆಟ್
02 ResRL: ಋಣಾತ್ಮಕ ಮಾದರಿ ಪ್ರೊಜೆಕ್ಷನ್ ಕಲಿಕೆಯ ಉಳಿದ ಬಲವರ್ಧನೆಯ ಮೂಲಕ LLM ತಾರ್ಕಿಕತೆಯನ್ನು ಬಲಪಡಿಸುವುದು
ResRL: ನಕಾರಾತ್ಮಕ ಮಾದರಿ ಪ್ರೊಜೆಕ್ಷನ್ ಮೂಲಕ, 宝差技好学乐技术大语语电视推理能力
ಪೇಪರ್ಗಳನ್ನು ಡೌನ್ಲೋಡ್ ಮಾಡಿ(ಪಿಡಿಎಫ್

ಪ್ರಬಂಧದ ಪರಿಚಯಈ ಪಠ್ಯವು ResRL ಅನ್ನು ಮುಂದಿಡುತ್ತದೆ, ಕಲಿಕೆಯನ್ನು ಬಲಪಡಿಸಲು ನಕಾರಾತ್ಮಕ ಮಾದರಿಗಳಿಗಾಗಿ ಹೊಸ ಅಲ್ಗಾರಿದಮ್, ಇದು ಔಟ್ಪುಟ್ ವೈವಿಧ್ಯತೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುವ LLM ನ ಸಾಮರ್ಥ್ಯವನ್ನು ಸುಧಾರಿಸುವ RLVR ನ ಸಮಸ್ಯೆಯನ್ನು ಪರಿಹರಿಸುವ ಗುರಿಯನ್ನು ಹೊಂದಿದೆ. ಪಾಸ್@ಕೆ 兼得.
03 CDRRM: ವಿಶ್ವಾಸಾರ್ಹ ಮತ್ತು ವ್ಯಾಖ್ಯಾನಿಸಬಹುದಾದ ಪ್ರತಿಫಲ ಮಾದರಿಗಳಿಗಾಗಿ ಕಾಂಟ್ರಾಸ್ಟ್ ಆಧಾರಿತ ರಬ್ರಿಕ್ ಉತ್ಪಾದನೆ
CDRRM: ವಿಶ್ವಾಸಾರ್ಹ ಮತ್ತು ವ್ಯಾಖ್ಯಾನಿಸಬಹುದಾದ ಪ್ರತಿಫಲ ಮಾಡೆಲಿಂಗ್ ಅನ್ನು ಸಾಧಿಸಲು ಹೋಲಿಸಬಹುದಾದ ಡ್ರೈವಿಂಗ್ ಸ್ಕೋರಿಂಗ್ ಮಾನದಂಡಗಳನ್ನು ರಚಿಸಲಾಗಿದೆ
ಪೇಪರ್ಗಳನ್ನು ಡೌನ್ಲೋಡ್ ಮಾಡಿ(ಪಿಡಿಎಫ್

ಪ್ರಬಂಧದ ಪರಿಚಯ: ಈ ಪಠ್ಯವು LLM ನ ಬಹುಮಾನ ಮಾದರಿಯ ವಿಶ್ವಾಸಾರ್ಹತೆ, ವ್ಯಾಖ್ಯಾನ ಮತ್ತು ಡೇಟಾ ದಕ್ಷತೆಯನ್ನು ಸುಧಾರಿಸುವ ಗುರಿಯನ್ನು ಹೊಂದಿರುವ ಹೋಲಿಕೆ-ಚಾಲಿತ ಸ್ಕೋರಿಂಗ್ ಮಾನದಂಡಗಳ ಉತ್ಪಾದನೆ ಮತ್ತು ಪ್ರತಿಫಲ ಮಾಡೆಲಿಂಗ್ ಚೌಕಟ್ಟನ್ನು CDRRM ಅನ್ನು ಮುಂದಿಡುತ್ತದೆ. CDRRM ಮೂರು ಮಾನದಂಡಗಳಲ್ಲಿ ಅತ್ಯಂತ ಮುಂದುವರಿದ ಮಟ್ಟದಲ್ಲಿದೆ, ಪಕ್ಷಪಾತ, ಸ್ಥಳ ಇತ್ಯಾದಿಗಳನ್ನು ನಿವಾರಿಸುತ್ತದೆ.
04 ಸ್ಥಳೀಯ ಹುಡುಕಾಟ ಬೆಂಚ್: ನೈಜ-ಪ್ರಪಂಚದ ಸ್ಥಳೀಯ ಜೀವನ ಸೇವೆಗಳಲ್ಲಿ ಬೆಂಚ್ಮಾರ್ಕಿಂಗ್ ಹುಡುಕಾಟ ಏಜೆಂಟ್
LocalSearchBench: 电影地地生活服务中国电影体电影电影电影机
ಪೇಪರ್ಗಳನ್ನು ಡೌನ್ಲೋಡ್ ಮಾಡಿ(ಪಿಡಿಎಫ್

ಪ್ರಬಂಧದ ಪರಿಚಯ: ಈ ಲೇಖನವು ಸ್ಥಳೀಯ ಜೀವನ ಸೇವಾ ಕ್ಷೇತ್ರದ ಬುದ್ಧಿವಂತ ಹುಡುಕಾಟ ಸಂಶೋಧನಾ ಅಂತರವನ್ನು ಗುರಿಯಾಗಿರಿಸಿಕೊಂಡಿದೆ, ಸ್ಥಳೀಯ ಹುಡುಕಾಟ ಬೆಂಚ್ ಮೌಲ್ಯಮಾಪನ ಮಾನದಂಡವನ್ನು ನಿರ್ಮಿಸಿ. ಬೆಂಚ್ಮಾರ್ಕ್ ದೇಶೀಯ 9 ನಗರಗಳು, 6 ಪ್ರಮುಖ ಸೇವಾ ಉತ್ಪನ್ನ ವಿಭಾಗಗಳನ್ನು ಒಳಗೊಂಡಿದೆ, 134 ಮಿಲಿಯನ್ಗಿಂತಲೂ ಹೆಚ್ಚು ವ್ಯಾಪಾರ ಡೇಟಾ ಮತ್ತು 900 ರಸ್ತೆ ಬಳಕೆದಾರರ ಬಹು-ಜಂಪ್ ಪ್ರಶ್ನೆ ಉತ್ತರ ಕಾರ್ಯಗಳನ್ನು ಒಳಗೊಂಡಿದೆ, ಸಂವಾದಾತ್ಮಕ ಪರಿಸರವನ್ನು ಬೆಂಬಲಿಸುವಾಗ LocalPlayground ಮತ್ತು ವ್ಯಾಪಾರ ಹುಡುಕಾಟ ಸಾಧನ LocalRAG. ಡೀಪ್.2 ಉತ್ತರಗಳು ನಿಖರತೆಯ ಪ್ರಮಾಣವು ಕೇವಲ 35.60% ಆಗಿದೆ, ಮಾಹಿತಿಯ ಸಂಪೂರ್ಣತೆ, ವಿಶ್ವಾಸಾರ್ಹತೆಯ ಕೊರತೆ ಇತ್ಯಾದಿ ಹಲವು ಸಮಸ್ಯೆಗಳಿವೆ.
05 ಡೈನಿಂಗ್ಬೆಂಚ್: ಆಹಾರದ ಗ್ರಹಿಕೆ ಮತ್ತು ತಾರ್ಕಿಕತೆಗಾಗಿ ಕ್ರಮಾನುಗತ ಬಹು-ನೋಟ ಮಾನದಂಡ
ಡೈನಿಂಗ್ಬೆಂಚ್;
ಪೇಪರ್ಗಳನ್ನು ಡೌನ್ಲೋಡ್ ಮಾಡಿ(ಪಿಡಿಎಫ್

ಪ್ರಬಂಧದ ಪರಿಚಯ: ಈ ಪ್ರಬಂಧವು ಡೈನಿಂಗ್ಬೆಂಚ್ ಅನ್ನು ಪ್ರಸ್ತುತಪಡಿಸುತ್ತದೆ, ಇದು ಆಹಾರ ಉದ್ಯಮಕ್ಕೆ ಶ್ರೇಣೀಕೃತ ಬಹು-ದೃಷ್ಟಿಕೋನ VLM ಮೌಲ್ಯಮಾಪನ ಮಾನದಂಡವಾಗಿದೆ, ಇದು ಏಕ-ಕಾರ್ಯ, ಸೀಮಿತ-ದೃಷ್ಟಿಕೋನ ಮತ್ತು ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಡೇಟಾಸೆಟ್ಗಳ ಸಾಕಷ್ಟು ಪೌಷ್ಟಿಕಾಂಶದ ಲೇಬಲಿಂಗ್ನ ಸಮಸ್ಯೆಗಳನ್ನು ಸರಿಪಡಿಸುವ ಗುರಿಯನ್ನು ಹೊಂದಿದೆ. ಮಾನದಂಡವು ಉತ್ತಮ-ಧಾನ್ಯದ ವರ್ಗೀಕರಣ, ಪೌಷ್ಟಿಕಾಂಶದ ಅಂದಾಜು ಮತ್ತು ದೃಶ್ಯ ಪ್ರಶ್ನೋತ್ತರವನ್ನು ಒಳಗೊಂಡಿದೆ, 3,021 ಆಹಾರ ಉತ್ಪನ್ನಗಳು ಮತ್ತು ಬಹು-ದೃಷ್ಟಿಕೋನ ಚಿತ್ರಗಳನ್ನು ಒಳಗೊಂಡಿದೆ. 29 ಮುಖ್ಯವಾಹಿನಿಯ VLM ಮಾದರಿಗಳನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವ ಮೂಲಕ, ಇದು ಉತ್ತಮ-ಧಾನ್ಯದ ಗುರುತಿಸುವಿಕೆ, ಪೌಷ್ಟಿಕಾಂಶದ ಅಂದಾಜು ಮತ್ತು ಬಹು-ದೃಷ್ಟಿಕೋನದ ಸಮ್ಮಿಳನದಲ್ಲಿ ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಮಾದರಿಗಳನ್ನು ಬಹಿರಂಗಪಡಿಸುತ್ತದೆ.
06 Mem²Evolve: ಸಹ-ವಿಕಸನೀಯ ಸಾಮರ್ಥ್ಯದ ವಿಸ್ತರಣೆ ಮತ್ತು ಅನುಭವ ಬಟ್ಟಿ ಇಳಿಸುವಿಕೆಯ ಮೂಲಕ ಸ್ವಯಂ-ವಿಕಸನಗೊಳ್ಳುವ ಏಜೆಂಟ್ಗಳ ಕಡೆಗೆ
Mem2Evolve: ಅನುಭವದೊಂದಿಗೆ ವಿಸ್ತರಿಸುವ ಸಾಮರ್ಥ್ಯವನ್ನು ವಿಸ್ತರಿಸುವ ಮೂಲಕ, ನಿಮ್ಮ ಸ್ವಂತ ಬುದ್ಧಿವಂತಿಕೆಯನ್ನು ನೀವು ಅರಿತುಕೊಳ್ಳಬಹುದು
ಪೇಪರ್ಗಳನ್ನು ಡೌನ್ಲೋಡ್ ಮಾಡಿ(ಪಿಡಿಎಫ್

ಪ್ರಬಂಧದ ಪರಿಚಯ: ಈ ಲೇಖನವು Mem2Evolve ಅನ್ನು ಪ್ರಸ್ತುತಪಡಿಸುತ್ತದೆ, ದೊಡ್ಡ ಭಾಷೆಯ ಮಾದರಿ ಬುದ್ಧಿಮತ್ತೆಗಾಗಿ ಸ್ವ-ಅಭಿವೃದ್ಧಿ ಚೌಕಟ್ಟನ್ನು ಆಸ್ತಿ ಮೆಮೊರಿ ಮತ್ತು ಅನುಭವ ಮೆಮೊರಿ ಡ್ಯುಯಲ್ ಮೆಮೊರಿ ಕಾರ್ಯವಿಧಾನದ ಮೂಲಕ, ಒಟ್ಟಿಗೆ ಅನುಭವವನ್ನು ವಿಸ್ತರಿಸುವ ಮತ್ತು ಸಂಗ್ರಹಿಸುವ ಸಾಮರ್ಥ್ಯವನ್ನು ಅರಿತುಕೊಳ್ಳಲು. ಕಾರ್ಯಗಳನ್ನು ಕ್ರಿಯಾತ್ಮಕವಾಗಿ ಕಾರ್ಯಗತಗೊಳಿಸಲು ಅಥವಾ ಪರಿಣಿತ ಬುದ್ಧಿವಂತಿಕೆಯೊಂದಿಗೆ ಪರಿಕರಗಳನ್ನು ರಚಿಸಲು ಈ ಚೌಕಟ್ಟನ್ನು ಬಳಸಬಹುದು, ಮತ್ತು ಅನುಭವವನ್ನು ಯಶಸ್ಸು ಮತ್ತು ವೈಫಲ್ಯದ ಟ್ರ್ಯಾಕ್ಗಳಿಂದ ವರ್ಗಾಯಿಸಬಹುದು. LLM ಮತ್ತು ಒಂದೇ ಪ್ರಗತಿಶೀಲ ತಂತ್ರ, ಹೆಚ್ಚು ಬಲವಾದ ನಿರಂತರ ಕಲಿಕೆ ಮತ್ತು ಕಾರ್ಯ ಸಾಮಾನ್ಯೀಕರಣ ಸಾಮರ್ಥ್ಯವನ್ನು ತೋರಿಸುತ್ತದೆ.