OpenAI ने LifeSciBench जारी किया: एक विशेषज्ञ-लिखित + विशेषज्ञ-समीक्षित जीवन विज्ञान AI बेंचमार्क

OpenAI ने LifeSciBench जारी किया है, जिसमें जीवन विज्ञान में AI की वास्तविक क्षमताओं का वैज्ञानिक मूल्यांकन करने के लिए 750 विशेषज्ञ-लिखित कार्य और 19,020 बारीक स्कोरिंग मानदंड शामिल हैं।

OpenAI ने LifeSciBench जारी किया है, जो एक जीवन विज्ञान AI बेंचमार्क है जिसे डोमेन विशेषज्ञों द्वारा लिखा और समीक्षा किया गया है। लाइफसाइंसबेंच में वास्तविक वैज्ञानिक अनुसंधान गतिविधियों से निकाले गए 750 मूल्यांकन कार्य शामिल हैं, जो आणविक जीव विज्ञान, जैव रसायन, आनुवंशिकी और दवा खोज जैसे क्षेत्रों को कवर करते हैं।

लाइफसाइंसबेंच अपनी मूल्यांकन पद्धति में अद्वितीय है: प्रत्येक कार्य के साथ विशेषज्ञ समीक्षकों की एक टीम द्वारा विकसित एक बढ़िया स्कोरिंग रूब्रिक होता है, जिसमें कुल 19,020 स्कोरिंग अंक होते हैं। यह मूल्यांकन की निष्पक्षता और सटीकता सुनिश्चित करता है और पारंपरिक बेंचमार्क परीक्षणों में "रैंकिंग को ब्रश करने" की आम समस्या से बचाता है।

OpenAI ने GPT-5.5 पर आधारित एक जीवन विज्ञान-विशिष्ट मॉडल संस्करण GPT-रोज़लिंड भी जारी किया, जिसने LifeSciBench पर अग्रणी परिणाम प्राप्त किए। ओपनएआई ने कहा कि जीवन विज्ञान में एआई के मानकीकृत मूल्यांकन को बढ़ावा देने के लिए लाइफसाइंसबेंच शिक्षा जगत के लिए खुला रहेगा।

लाइफसाइंसबेंच का लॉन्च जीवन विज्ञान में एआई के मानकीकृत मूल्यांकन में अंतर को भरता है। यह डिज़ाइन विचार कि सभी 750 कार्य वास्तविक वैज्ञानिक अनुसंधान गतिविधियों से आते हैं, घरेलू एआई मूल्यांकन संस्थानों द्वारा संदर्भ के योग्य है - कृत्रिम रूप से निर्मित "परीक्षा प्रश्न" नहीं, बल्कि अग्रिम पंक्ति से "व्यावहारिक प्रश्न"। इसका मतलब यह है कि लाइफसाइंसबेंच के माध्यम से मूल्यांकन किए गए मॉडल वास्तविक वैज्ञानिक अनुसंधान परिदृश्यों में अधिक पूर्वानुमानित प्रदर्शन करेंगे।

कॉपीराइट: सामग्री स्रोत ओपनएआई आधिकारिक ब्लॉग । इस प्लेटफॉर्म ने सूचना प्रसार और सीखने के आदान-प्रदान के उद्देश्य से इस सामग्री को संकलित और व्यवस्थित किया है। कॉपीराइट संबंधी चिंताओं के लिए कृपया हमसे संपर्क करें।

समीक्षाएं

  • समीक्षाएं लोड हो रही हैं...