{"canonicalLink":"https://www.snowflake.com/de/artificial-intelligence/machine-learning/reinforcement-learning/rlhf/","robotsTags":[],"allowedRenditionsWidth":["320","480","640","768","960","1200","1440","1920"],"cssClassNames":"page basicpage summit-page","templateName":"base-page-template54","description":"Erfahren Sie, wie RLHF (Reinforcement Learning from Human Feedback) KI-Modelle durch Reward Modeling und Policy Optimization an menschliche Präferenzen anpasst.","language":"de","title":"Was ist RLHF? Reinforcement Learning from Human Feedback | Snowflake","analyticsPageType":"homepage","analyticsCategory":"general","analyticsSubCategory":"","excludeFromAnalytics":false,":itemsOrder":["root"],":items":{"root":{"columnClassNames":{"markup_editor_928258845":"aem-GridColumn aem-GridColumn--default--12","experiencefragment-banner":"aem-GridColumn aem-GridColumn--default--12","experiencefragment-header":"aem-GridColumn aem-GridColumn--default--12","responsivegrid":"aem-GridColumn aem-GridColumn--default--12","markup_editor_597730182":"aem-GridColumn aem-GridColumn--default--12","experiencefragment-footer":"aem-GridColumn aem-GridColumn--default--12","experiencefragment":"aem-GridColumn aem-GridColumn--default--12","modal_container":"aem-GridColumn aem-GridColumn--default--12","markup_editor":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","columnCount":12,":itemsOrder":["experiencefragment-banner","experiencefragment-header","responsivegrid","modal_container","markup_editor_928258845","markup_editor_597730182","markup_editor","experiencefragment-footer","experiencefragment"],":items":{"experiencefragment-banner":{"id":"experiencefragment-2f628cbf87","localizedFragmentVariationPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/pushdown-banner/master/jcr:content","configured":true,"xfModelPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/pushdown-banner/master.xfmodel.json",":type":"snowflake-site/components/experiencefragment"},"experiencefragment-header":{"id":"experiencefragment-307cf0027f","localizedFragmentVariationPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/mega-nav-header/master/jcr:content","configured":true,"xfModelPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/mega-nav-header/master.xfmodel.json","languageNavPath":"/content/snowflake-site/global/de/artificial-intelligence/machine-learning/reinforcement-learning/rlhf.languagenav.json",":type":"snowflake-site/components/experiencefragment"},"responsivegrid":{"columnClassNames":{"flexible_column_cont_939100716":"aem-GridColumn aem-GridColumn--default--12","flexible_column_cont":"aem-GridColumn aem-GridColumn--default--12","flexible_column_cont_1158003461":"aem-GridColumn aem-GridColumn--default--12","flexible_column_cont_663228916":"aem-GridColumn aem-GridColumn--default--12","flexible_column_cont_912630531":"aem-GridColumn aem-GridColumn--default--12","flexible_column_cont_1398138236":"aem-GridColumn aem-GridColumn--default--12","flexible_column_cont_topics_row2":"aem-GridColumn aem-GridColumn--default--12","flexible_column_cont_1786318617":"aem-GridColumn aem-GridColumn--default--12","flexible_column_cont_1467213961":"aem-GridColumn aem-GridColumn--default--12","flexible_column_cont_1377146023":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","columnCount":12,":itemsOrder":["flexible_column_cont","flexible_column_cont_939100716","flexible_column_cont_1398138236","flexible_column_cont_663228916","flexible_column_cont_1786318617","flexible_column_cont_1467213961","flexible_column_cont_912630531","flexible_column_cont_1158003461","flexible_column_cont_1377146023","flexible_column_cont_topics_row2"],":items":{"flexible_column_cont":{"id":"flexible-column-container-70c7d1fe64","propertiesId":"hub-hero-breadcrumbs","type":"1-column","alignColumns":"top","containerMaxWidth":"extra-large","topPadding":"small","bottomPadding":"none","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"propertiesCSSClasses":"page-section","backgroundImageOption":"none","flexible_column_content_container_1":{"layout":"SIMPLE","id":"container-424e6c4726",":itemsOrder":["breadcrumb"],":items":{"breadcrumb":{"id":"breadcrumb-ee21658c3b","items":[{"id":"breadcrumb-ee21658c3b-item-1b882f3034","link":{"valid":true,"url":"/de/artificial-intelligence/machine-learning/"},"active":false,"current":false,"title":"Machine Learning",":type":"snowflake-site/components/structure/page","appliedCssClassNames":"summit-page"},{"id":"breadcrumb-ee21658c3b-item-8ac6a2f41a","link":{"valid":true,"url":"/de/artificial-intelligence/machine-learning/reinforcement-learning/"},"active":false,"current":false,"title":"Reinforcement Learning",":type":"snowflake-site/components/structure/fundamentals-page","appliedCssClassNames":"summit-page"},{"id":"breadcrumb-ee21658c3b-item-1178fc72cc","link":{"valid":true,"url":"/de/artificial-intelligence/machine-learning/reinforcement-learning/rlhf/"},"active":true,"current":true,"title":"RLHF",":type":"snowflake-site/components/structure/page","appliedCssClassNames":"summit-page"}],":type":"snowflake-site/components/breadcrumb"}},":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container"},"isActiveTOC":false,"isBlogPage":false,":type":"snowflake-site/components/flexible-column-container","appliedCssClassNames":"snowflake-flexible-column-container-gray-10-bg"},"flexible_column_cont_939100716":{"id":"flexible-column-container-ea12253e79","propertiesId":"hub-hero","type":"2-column-even","alignColumns":"center","containerMaxWidth":"extra-large","topPadding":"extra-small","bottomPadding":"extra-small","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"propertiesCSSClasses":"page-section","backgroundImageOption":"none","flexible_column_content_container_1":{"layout":"SIMPLE","id":"container-e5a8f97fa6",":itemsOrder":["title_v2","text","container"],":items":{"title_v2":{"id":"title-v2-39478d9503","additionalClasses":"hub-hero__headline","type":"heading1","lines":["RLHF: Menschliches Feedback zur Verhaltensanpassung von KI-Modellen nutzen"],":type":"snowflake-site/components/title-v2","appliedCssClassNames":"left-alignment"},"text":{"id":"text-8f438057e8","additionalClasses":"hub-hero__subheadline","text":"\u003Cp\u003ERLHF bietet Modellentwickler:innen eine Möglichkeit, LLMs dabei zu unterstützen, Antworten zu generieren, die nicht nur flüssig, sondern auch nützlich, vertrauenswürdig, angemessen und auf die Absicht der Nutzer:innen abgestimmt sind. Für Unternehmen bringt diese Technik auch eine Governance-Herausforderung mit sich: Präferenzdaten, Reward-Modelle und Feedbackschleifen müssen mit derselben Disziplin verwaltet werden wie die Modelle, die sie prägen.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-regular text-color-text-05"},"container":{"additionalClasses":"hub-hero__authors","columnClassNames":{"content_chip_copy":"aem-GridColumn aem-GridColumn--default--12","content_chip":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","layout":"RESPONSIVE_GRID","columnCount":12,"id":"container-1f1b07571d",":itemsOrder":["content_chip","content_chip_copy"],":items":{"content_chip":{"id":"content-chip-bf9293d900","cta":{"id":"cta","showOutboundIcon":false,"linkTargetContentType":"GENERIC",":type":"snowflake-site/components/button","linkType":"SNOWFLAKE_INTERNAL","text":"Biografie lesen"},"image":{"id":"image","alt":"Laurie MacPherson","src":"https://www.snowflake.com/adobe/dynamicmedia/deliver/dm-aid--a7e9fdff-6f08-4edc-9cd1-e213bb234aaa/laurie-macpherson.jpg?preferwebp=true&quality=85","lazyEnabled":true,"isLcpImage":true,"width":"800","height":"800",":type":"snowflake-site/components/image"},"headline":{"id":"title","type":"heading5","lines":["Laurie MacPherson","Technical Writer, Snowflake"],":type":"snowflake-site/components/title-v2"},":type":"snowflake-site/components/content-chip"},"content_chip_copy":{"id":"content-chip-199a273aa0","cta":{"id":"cta","showOutboundIcon":false,"buttonLink":{"valid":true,"url":"https://www.snowflake.com/en/blog/authors/gulnaz-sharipova/"},"linkTargetContentType":"GENERIC",":type":"snowflake-site/components/button","linkType":"SNOWFLAKE_EXTERNAL","text":"Biografie lesen"},"image":{"id":"image","alt":"Gulnaz Sharipova","src":"https://www.snowflake.com/adobe/dynamicmedia/deliver/dm-aid--f7c921fe-d10f-4d90-ac38-c79aff7cf132/gulnaz-photo.jpg?preferwebp=true&quality=85","lazyEnabled":true,"isLcpImage":false,"width":"512","height":"512",":type":"snowflake-site/components/image"},"headline":{"id":"title","type":"heading5","lines":["Gulnaz Sharipova","Lokale Redakteurin, Snowflake"],":type":"snowflake-site/components/title-v2"},":type":"snowflake-site/components/content-chip"}},":type":"snowflake-site/components/container","appliedCssClassNames":"snowflake-responsive-container-inner-padding-small"}},":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container","appliedCssClassNames":"snowflake-responsive-container-inner-padding-extra-small"},"flexible_column_content_container_2":{"additionalClasses":"hub-hero__video-column","layout":"SIMPLE","id":"container-f27c4cf86b",":itemsOrder":["youtube"],":items":{"youtube":{"id":"embed-7226457e57","youtubeVideoId":"-HWNc-Hd90U","layout":"responsive","youtubeAspectRatio":"56.25","youtubeAutoPlay":false,"youtubeLoop":false,"youtubeMute":false,"youtubePlaysInline":false,"youtubeRel":false,"embeddableResourceType":"core/wcm/components/embed/v1/embed/embeddable/youtube","type":"EMBEDDABLE",":type":"snowflake-site/components/youtube"}},":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container"},"isActiveTOC":false,"isBlogPage":false,":type":"snowflake-site/components/flexible-column-container","appliedCssClassNames":"snowflake-flexible-column-container-gray-10-bg"},"flexible_column_cont_1398138236":{"id":"flexible-column-container-94a5822b06","propertiesId":"hub-hero-related-topics","type":"1-column","alignColumns":"top","containerMaxWidth":"extra-large","topPadding":"extra-small","bottomPadding":"medium","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"propertiesCSSClasses":"page-section","backgroundImageOption":"none","flexible_column_content_container_1":{"additionalClasses":"related-topics-outer-container border-top","layout":"SIMPLE","id":"container-c41f961c4d",":itemsOrder":["text_894059747","text"],":items":{"text_894059747":{"id":"text-c02e7649e8","additionalClasses":"seo-hub-hero__related-topic-label","text":"\u003Cp\u003EThemen rund um maschinelles Lernen:\u003C/p\u003E\r\n","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-regular text-color-text-05"},"text":{"id":"text-5877eb61bd","additionalClasses":"related-topics ","text":"\u003Cul\u003E\n\u003Cli\u003E\u003Ca href=\"https://www.snowflake.com/en/artificial-intelligence/machine-learning/automl/\"\u003EAutoML\u003C/a\u003E\u003C/li\u003E\n\u003Cli\u003E\u003Ca href=\"https://www.snowflake.com/de/artificial-intelligence/machine-learning/deep-learning/\"\u003EDeep Learning\u003C/a\u003E\u003C/li\u003E\n\u003Cli\u003E\u003Ca href=\"https://www.snowflake.com/de/artificial-intelligence/machine-learning/ensemble-learning/\"\u003EEnsemble Learning\u003C/a\u003E\u003C/li\u003E\n\u003Cli\u003E\u003Ca href=\"https://www.snowflake.com/de/artificial-intelligence/machine-learning/feature-engineering/\"\u003EFeature Engineering\u003C/a\u003E\u003C/li\u003E\n\u003Cli\u003E\u003Ca href=\"https://www.snowflake.com/en/artificial-intelligence/machine-learning/frameworks/\"\u003EML-Frameworks\u003C/a\u003E\u003C/li\u003E\n\u003Cli\u003E\u003Ca href=\"https://www.snowflake.com/de/artificial-intelligence/machine-learning/inference/\"\u003EML-Inferenz\u003C/a\u003E\u003C/li\u003E\n\u003Cli\u003E\u003Ca href=\"https://www.snowflake.com/en/artificial-intelligence/machine-learning/models/\"\u003EML-Modelle\u003C/a\u003E\u003C/li\u003E\n\u003Cli\u003E\u003Ca href=\"https://www.snowflake.com/de/artificial-intelligence/machine-learning/mlops/\"\u003EMLOps\u003C/a\u003E\u003C/li\u003E\n\u003Cli\u003E\u003Ca href=\"https://www.snowflake.com/de/artificial-intelligence/machine-learning/reinforcement-learning/\"\u003EReinforcement Learning\u003C/a\u003E\u003C/li\u003E\n\u003C/ul\u003E\n","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-small"}},":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container"},"isActiveTOC":false,"isBlogPage":false,":type":"snowflake-site/components/flexible-column-container","appliedCssClassNames":"snowflake-flexible-column-container-gray-10-bg"},"flexible_column_cont_663228916":{"id":"flexible-column-container-a25acce537","propertiesId":"hub-body","type":"2-column-60-40","alignColumns":"top","containerMaxWidth":"extra-large","topPadding":"medium","bottomPadding":"medium","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"propertiesCSSClasses":"page-section","backgroundImageOption":"none","flexible_column_content_container_1":{"additionalClasses":"longform-content","layout":"SIMPLE","id":"hub-body-content",":itemsOrder":["callout__0","text__0","title_what-is-rlhf","text_what-is-rlhf_0","title_how-the-rlhf-pipeline-works","text_how-the-rlhf-pipeline-works_0","callout_how-the-rlhf-pipeline-works_0","text_how-the-rlhf-pipeline-works_1","title_challenges-and-alternatives-to-rlhf","text_challenges-and-alternatives-to-rlhf_0","callout_challenges-and-alternatives-to-rlhf_0","text_challenges-and-alternatives-to-rlhf_1","title_rlhf-and-dpo-on-snowflake","text_rlhf-and-dpo-on-snowflake_0","title_enterprise-model-training-depends-on-governed-feedback-loops","text_enterprise-model-training-depends-on-governed-feedback-loops_0","callout_enterprise-model-training-depends-on-governed-feedback-loops_0"],":items":{"callout__0":{"id":"text-a132427683","additionalClasses":"callout callout--general","text":"\u003Cp\u003E\u003Cstrong\u003ERLHF DEFINIERT\u003C/strong\u003E\u003C/p\u003E\n\u003Cp\u003ERLHF ist eine Trainingsmethode für \u003Ca href=\"https://www.snowflake.com/de/artificial-intelligence/machine-learning/\"\u003Emaschinelles Lernen\u003C/a\u003E, bei der ein KI-System lernt, sein Verhalten basierend auf dem Feedback von Menschen zu verbessern. Menschen vergleichen oder bewerten Modellausgaben, und dieses Feedback wird verwendet, um ein Reward-Modell zu trainieren. Die KI wird dann dahingehend optimiert, Antworten zu generieren, die gemäß diesem Reward-Modell besser abschneiden.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-regular text-color-text-05"},"text__0":{"id":"text-3fc6d02e0b","text":"\u003Cp\u003EEin Sprachmodell weiß vielleicht, wie bestimmte Arten von Antworten normalerweise strukturiert sind – sei es eine Antwort des Kundensupports, eine Zusammenfassung einer Unternehmensrichtlinie oder eine Erklärung einer SQL-Abfrage –, aber ihm fehlt das nötige Urteilsvermögen, um die Ausgabe brauchbar zu machen. Dieses mangelnde Urteilsvermögen kann schwerwiegende Folgen für ein Unternehmen haben. Ein Modell, das Marketingtexte schreibt, Verträge zusammenfasst, Analyst:innen unterstützt oder Fragen von Mitarbeitenden beantwortet, agiert in einem Kontext, in dem Tonalität, Genauigkeit, Sicherheit und Richtliniengrenzen darüber entscheiden, ob der Ausgabe vertraut werden kann.\u003C/p\u003E\n\u003Cp\u003EReinforcement Learning from Human Feedback (RLHF) hat sich zu einer der wichtigsten Techniken entwickelt, um dieses mangelnde Urteilsvermögen zu beheben. Anstatt sich nur auf die Vorhersage des nächsten Tokens oder überwachte Beispiele zu verlassen, führt RLHF ein Präferenzsignal ein: Menschen vergleichen Modellausgaben, diese Vergleiche trainieren ein Reward-Modell, und das Sprachmodell wird optimiert, um Antworten zu generieren, die gemäß diesem erlernten Modell menschlicher Präferenzen besser abschneiden.\u003C/p\u003E\n\u003Cp\u003EObwohl RLHF kein Ersatz für Governance, Evaluierung oder Monitoring ist, bietet es Modellentwickler:innen eine Möglichkeit, Eigenschaften zu trainieren, die sich nur schwer als statisches Regelwerk ausdrücken lassen, darunter Unbedenklichkeit, Relevanz und die Fähigkeit, einer Absicht zu folgen.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"title_what-is-rlhf":{"id":"title-v2-4a6699a8a0","additionalClasses":"anchor-title anchor-title--what-is-rlhf","type":"heading2","lines":["Was ist RLHF?"],":type":"snowflake-site/components/title-v2"},"text_what-is-rlhf_0":{"id":"text-c52370b05b","text":"\u003Cp\u003ERLHF ist eine Technik, um Sprachmodelle an menschliche Präferenzen anzupassen. In einem typischen Workflow beginnen Teams mit einem vortrainierten Basismodell, unterziehen es einer Feinanpassung anhand von Beispielen für das gewünschte Verhalten, trainieren ein Reward-Modell mit menschlichen Vergleichsdaten und optimieren dann das Sprachmodell, um Ausgaben zu generieren, die die Punktzahl des Reward-Modells maximieren.\u003C/p\u003E\n\u003Cp\u003ERLHF erweitert die überwachte Feinanpassung, die einem Modell Beispiele für das gewünschte Verhalten zeigt. RLHF fügt ein Präferenzsignal hinzu, das dem Modell hilft zu lernen, welche Antwort Menschen für besser halten, wenn mehrere Ausgaben technisch möglich sind. Beispielsweise können zwei Ausgaben beide eine Frage zu einer Leistungsrichtlinie beantworten, aber eine zitiert möglicherweise die richtige Richtliniengrenze, vermeidet rechtliche Übertreibungen und teilt den Mitarbeitenden mit, wo sie ihre Anspruchsberechtigung bestätigen können, während die andere dies nicht tut. Bei dieser Präferenz geht es nicht nur um den sachlichen Inhalt – sie spiegelt ein Urteil darüber wider, was eine hilfreiche Antwort leisten sollte.\u003C/p\u003E\n\u003Cp\u003EDie Arbeit von OpenAI zu InstructGPT aus dem Jahr 2022 ist der Standardreferenzpunkt für RLHF in modernen Sprachmodellen. Die Forscher:innen zeigten, dass eine Feinanpassung mit menschlichem Feedback Modelle besser auf die Absicht der Nutzer:innen abstimmen kann, was auch die Reduzierung von unwahren, toxischen oder wenig hilfreichen Ausgaben einschließt.\u003C/p\u003E\n\u003Cp\u003ERLHF für Sprachmodelle unterscheidet sich in einem wichtigen Punkt vom standardmäßigen \u003Ca href=\"https://www.snowflake.com/de/artificial-intelligence/machine-learning/reinforcement-learning/\"\u003EReinforcement Learning\u003C/a\u003E. In einem Spiel oder einer Simulation kann die Umgebung oft eine direkte Belohnung liefern: Der Agent gewinnt, verliert, erreicht ein Ziel oder sammelt Punkte. Bei RLHF für Sprachmodelle ist die Umgebung das menschliche Urteilsvermögen und die Belohnung ist kein Ground-Truth-Score, sondern vielmehr eine erlernte Annäherung an menschliche Präferenzen, die anhand von Vergleichsdaten trainiert wurde.\u003C/p\u003E\n\u003Cp\u003ERLHF ist leistungsstark, aber auch unvollkommen. Das Reward-Modell weiß nicht in einem absoluten Sinn, was Menschen wollen. Es kann nur Muster aus den erhaltenen Präferenzdaten lernen. Das bedeutet, dass die Qualität, Vielfalt und Konsistenz dieser Daten das Verhalten prägen, das das endgültige Modell lernt.\u003C/p\u003E\n","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"title_how-the-rlhf-pipeline-works":{"id":"title-v2-b4c23a3987","additionalClasses":"anchor-title anchor-title--how-the-rlhf-pipeline-works","type":"heading2","lines":["So funktioniert die RLHF-Pipeline"],":type":"snowflake-site/components/title-v2"},"text_how-the-rlhf-pipeline-works_0":{"id":"text-71a0b5fa11","text":"\u003Cp\u003EEine RLHF-Pipeline umfasst in der Regel drei Phasen: überwachte Feinanpassung, Training des Reward-Modells und Policy Optimization durch Reinforcement Learning. Jede Phase fügt eine andere Art von Signal hinzu und bewegt das Modell von allgemeinen Sprachfähigkeiten hin zu einem Verhalten, das die menschliche Absicht besser widerspiegelt.\u003C/p\u003E\n\u003Ch3\u003EPhase 1: Überwachte Feinanpassung\u003C/h3\u003E\n\u003Cp\u003EDie Pipeline beginnt in der Regel mit einem vortrainierten Basismodell. Dieses Basismodell hat zwar breite Sprachmuster aus großen Trainingskorpora gelernt, aber nicht zwangsläufig, wie es sich als anweisungsbefolgender Assistent in einem bestimmten Kontext verhalten soll.\u003C/p\u003E\n\u003Cp\u003EDie überwachte Feinanpassung (Supervised Fine-Tuning, SFT) liefert dem Modell Demonstrationsdaten: Prompts, die mit hochwertigen, von Menschen verfassten Antworten gepaart sind. Diese Beispiele lehren das Modell die Form des gewünschten Verhaltens. Diese Phase schafft ein anfängliches anweisungsbefolgendes Modell, löst aber noch nicht das Präferenzproblem – Demonstrationen zeigen, wie eine gute Ausgabe aussehen kann, aber sie lehren das Modell nicht direkt, wie es zwischen mehreren akzeptablen Antworten wählen soll, wenn eine hilfreicher, sicherer oder besser auf die Absicht der Nutzer:innen abgestimmt ist.\u003C/p\u003E\n\u003Ch3\u003EPhase 2: Training des Reward-Modells\u003C/h3\u003E\n\u003Cp\u003EIn der zweiten Phase werden Vergleichsdaten eingeführt. Menschliche Annotator:innen überprüfen mehrere Modellausgaben für denselben Prompt und ordnen sie von der besten zur schlechtesten oder wählen die bevorzugte Antwort aus einem Paar. Diese Rangfolgen werden zu Trainingsdaten für ein Reward-Modell, das lernt, vorherzusagen, welche Ausgabe ein Mensch bevorzugen würde.\u003C/p\u003E\n\u003Cp\u003EDies ist der entscheidende Schritt bei RLHF. Anstatt Menschen zu bitten, jede ideale Antwort zu schreiben, fordert die Pipeline sie auf, Präferenzen zwischen Antwortkandidaten auszudrücken. Das macht es möglich, ein Modell auf nuanciertere Urteile zu trainieren: Welche Antwort direkter ist, welche besser mit Unsicherheit umgeht, welche zu ausweichend ist, welche unbelegte Behauptungen enthält und welche besser zum erwarteten Tonfall passt.\u003C/p\u003E\n\u003Cp\u003EDas Reward-Modell ist in der Regel ein modifiziertes Sprachmodell, das einen Prompt und eine Antwort als Eingabe nimmt und dann einen Score zurückgibt. Dieser Score wird in der nächsten Trainingsphase zu einem Proxy für menschliche Präferenzen.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"callout_how-the-rlhf-pipeline-works_0":{"id":"text-819e1250dd","additionalClasses":"callout callout--warning","text":"\u003Cp\u003E\u003Cstrong\u003EHÄUFIGER FALLSTRICK\u003C/strong\u003E\u003C/p\u003E\n\u003Cp\u003EAchten Sie darauf, das Reward-Modell nicht als objektives Qualitätsmaß zu betrachten. Ein Reward-Modell lernt nur Muster aus menschlichen Präferenzdaten. Daher kann voreingenommenes, inkonsistentes oder qualitativ minderwertiges Feedback dazu führen, dass das Sprachmodell auf falsche Verhaltensweisen optimiert wird.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-regular text-color-text-05"},"text_how-the-rlhf-pipeline-works_1":{"id":"text-eb82e83821","text":"\u003Ch3\u003EPhase 3: RL-Policy Optimization\u003C/h3\u003E\n\u003Cp\u003EIn der dritten Phase wird das SFT-Modell zur Policy, die optimiert wird. Das Modell generiert Antworten, das Reward-Modell bewertet sie, und ein RL-Algorithmus wie Proximal Policy Optimization (PPO) aktualisiert das Sprachmodell, sodass es Ausgaben produziert, die höhere Belohnungsscores erhalten.\u003C/p\u003E\n\u003Cp\u003EIn dieser Phase kann das System instabil werden, wenn es nicht sorgfältig eingeschränkt wird. Wenn das Modell zu aggressiv gegen das Reward-Modell optimiert, entdeckt es möglicherweise Ausgaben, die gut abschneiden, ohne tatsächlich nützlicher zu werden. Dies wird als Reward Hacking bezeichnet: Das Modell nutzt Schwächen im Reward-Modell aus, anstatt das zugrunde liegende Verhalten zu verbessern.\u003C/p\u003E\n\u003Cp\u003EUm dieses Risiko zu verringern, enthalten RLHF-Pipelines oft eine Kullback-Leibler-Divergenzstrafe (KL), die verhindert, dass das optimierte Modell zu weit von dem Modell mit überwachter Feinanpassung abweicht. In der Praxis verhindert die KL-Strafe, dass sich das Modell auf der Jagd nach Belohnungen zu stark verändert, und hilft dabei, die Sprachqualität und das während der SFT erlernte anweisungsbefolgende Verhalten zu bewahren.\u003C/p\u003E\n\u003Cp\u003EViele RLHF-Systeme laufen auch iterativ ab. Neue Modellausgaben decken neue Fehlermodi auf, menschliche Prüfer:innen generieren zusätzliche Präferenzdaten, das Reward-Modell wird aktualisiert und die Policy wird erneut optimiert. Die Pipeline gleicht weniger einem einmaligen Trainingsrezept als vielmehr einer Feedbackschleife zur Verhaltensformung.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"title_challenges-and-alternatives-to-rlhf":{"id":"title-v2-09c150465a","additionalClasses":"anchor-title anchor-title--challenges-and-alternatives-to-rlhf","type":"heading2","lines":["Herausforderungen und Alternativen zu RLHF"],":type":"snowflake-site/components/title-v2"},"text_challenges-and-alternatives-to-rlhf_0":{"id":"text-eec48339ab","text":"\u003Cp\u003ERLHF gewann an Einfluss, weil es Modellentwickler:innen einen praktikablen Weg bot, auf menschliche Präferenzen zu trainieren. Die Methode bringt jedoch ihre eigenen operativen und Governance-Probleme mit sich. Das Signal ist nur so gut wie die Vergleichsdaten, das Reward-Modell kann von dem Verhalten abweichen, das die Menschen tatsächlich wollen, und die RL-Optimierung lässt sich mitunter nur schwer zuverlässig ausführen.\u003C/p\u003E\n\u003Ch3\u003EQualität der Präferenzdaten\u003C/h3\u003E\n\u003Cp\u003EPräferenzdaten klingen unkompliziert, bis Teams definieren müssen, wer die Präferenz angibt und welchen Standard sie anwenden. Annotator:innen können unterschiedlicher Meinung darüber sein, ob eine Antwort für einen bestimmten Kontext hilfreicher, vorsichtiger oder angemessener ist. Kulturelle Annahmen können sich ebenfalls auf Labels auswirken, insbesondere wenn Prompts Tonfall, Sicherheit, medizinischen Rat, finanzielle Entscheidungen oder andere hochriskante Themen betreffen.\u003C/p\u003E\n\u003Cp\u003EKI-Systeme für Unternehmen fügen eine weitere Ebene hinzu. Ein Modell, das für internen HR-Support, regulierte Branchen-Workflows oder kundenorientierten Service verwendet wird, benötigt möglicherweise Präferenzdaten von Personen, die die Domäne verstehen, und nicht nur von allgemeinen Annotator:innen. Dies erhöht die Kosten- und Koordinationsanforderungen, da Fachexpert:innen schwerer zu skalieren sind als große Teams von Labeling-Arbeitskräften.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"callout_challenges-and-alternatives-to-rlhf_0":{"id":"text-9e2e8f7b32","additionalClasses":"callout callout--tip","text":"\u003Cp\u003E\u003Cstrong\u003EKURZER TIPP\u003C/strong\u003E\u003C/p\u003E\n\u003Cp\u003EDie besten RLHF-Ergebnisse stammen aus domänenspezifischem Feedback. Präferenzdaten von Fachexpert:innen sind oft wertvoller als große Mengen an generischen menschlichen Bewertungen.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-regular text-color-text-05"},"text_challenges-and-alternatives-to-rlhf_1":{"id":"text-293398e6df","text":"\u003Ch3\u003EEinschränkungen des Reward-Modells\u003C/h3\u003E\n\u003Cp\u003EDas Reward-Modell ist eine erlernte Annäherung, keine Autorität. Es kann unzuverlässiger werden, wenn die optimierte Policy Ausgaben generiert, die sich von den Beispielen unterscheiden, die das Reward-Modell während des Trainings gesehen hat. Dieser Distribution Shift bedeutet, dass das Reward-Modell möglicherweise Antworten in Bereichen bewerten muss, in denen sein eigenes Trainingssignal schwach ist.\u003C/p\u003E\n\u003Cp\u003EReward Hacking ist eine weitere Einschränkung. Wenn das Modell Muster lernt, die das Reward-Modell überbewertet, kann es Antworten generieren, die laut der Bewertung zwar bevorzugt erscheinen, aber für Nutzer:innen nicht tatsächlich besser sind. Beispielsweise kann es lernen, selbstbewusst klingende Erklärungen hinzuzufügen, sich übermäßig abzusichern oder oberflächlichen Mustern zu folgen, die Annotator:innen zuvor belohnt haben.\u003C/p\u003E\n\u003Ch3\u003ETrainingsinstabilität\u003C/h3\u003E\n\u003Cp\u003EDer RL-Schritt kann ebenfalls schwer anzupassen sein. \u003Ca href=\"https://huggingface.co/blog/NormalUhr/rlhf-pipeline\" target=\"_blank\"\u003EPPO-basierte RLHF-Pipelines\u003C/a\u003E umfassen mehrere bewegliche Teile: das Policy-Modell, das Reward-Modell, das Referenzmodell, die KL-Einschränkung, die Sampling-Strategie, die Lernrate, die Batch-Größen und andere Hyperparameter. Die traditionelle RLHF-Pipeline ist komplexer als überwachtes Lernen, da sie das Training mehrerer Sprachmodelle, das Sampling aus der Policy während des Trainings und erhebliche Rechenkosten umfassen kann.\u003C/p\u003E\n\u003Cp\u003EFür Unternehmens-Teams kann diese Komplexität erheblich sein, da sich die Alignment-Arbeit in einen breiteren Modell-Lebenszyklus einfügen muss. Präferenzdaten erfordern Governance. Trainingsjobs müssen reproduzierbar sein. Modellversionen benötigen Lineage. Die Evaluierung muss zeigen, ob das ausgerichtete Modell die Verhaltensweisen, die für den Workload wichtig sind, tatsächlich verbessert hat.\u003C/p\u003E\n\u003Ch3\u003EDirect Preference Optimization\u003C/h3\u003E\n\u003Cp\u003E\u003Ca href=\"https://arxiv.org/abs/2305.18290\" target=\"_blank\"\u003EDirect Preference Optimization\u003C/a\u003E (DPO) ist eine der nützlichsten Alternativen zu RLHF. Anstatt ein separates Reward-Modell zu trainieren und dann Reinforcement Learning durchzuführen, optimiert DPO das Sprachmodell direkt mithilfe von Präferenzpaaren. DPO bietet eine Möglichkeit, dasselbe eingeschränkte Reward-Ziel durch einen einfacheren Trainingsprozess im Klassifizierungsstil zu optimieren, ohne explizite Reward-Modellierung oder RL.\u003C/p\u003E\n\u003Cp\u003EGenau diese Einfachheit macht den Reiz aus. DPO kann die betriebliche Komplexität von RLHF reduzieren, indem das separate Reward-Modell und die PPO-Trainingsschleife entfallen, was die Präferenz-Anpassung stabiler und einfacher zu implementieren machen kann. Es beseitigt nicht den Bedarf an starken Präferenzdaten, ändert aber die Art und Weise, wie diese Daten verwendet werden.\u003C/p\u003E\n\u003Ch3\u003EConstitutional AI und RLAIF\u003C/h3\u003E\n\u003Cp\u003EConstitutional AI (CAI) und Reinforcement Learning from AI Feedback (RLAIF) befassen sich mit einem anderen Skalierungsproblem: Menschliches Feedback ist teuer, insbesondere wenn das Modell anhand vieler schädlicher, mehrdeutiger oder Edge-Case-Prompts evaluiert werden muss. \u003Ca href=\"https://constitutional.ai/\" target=\"_blank\"\u003EConstitutional AI\u003C/a\u003E wurde von Anthropic entwickelt. Es verwendet eine Reihe von schriftlichen Prinzipien, um die Selbstkritik und Überarbeitung der KI zu steuern, wodurch die Abhängigkeit von menschlichen Labels für schädliche Ausgaben verringert wird.\u003C/p\u003E\n\u003Cp\u003ERLAIF erweitert dieselbe Idee, indem LLM-Judges verwendet werden, um anstelle von oder zusammen mit menschlichen Annotator:innen Feedback zu geben. Dies kann die Labeling-Kosten senken und die Skalierung erhöhen, wirft aber auch ein zentrales Alignment-Problem auf: Wenn KI-generiertes Feedback menschliche Präferenzdaten ersetzt, müssen Teams verstehen, wessen Werte, Richtlinien und Fehlermodi verstärkt werden.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"title_rlhf-and-dpo-on-snowflake":{"id":"title-v2-7595c7b1ff","additionalClasses":"anchor-title anchor-title--rlhf-and-dpo-on-snowflake","type":"heading2","lines":["RLHF und DPO bei Snowflake"],":type":"snowflake-site/components/title-v2"},"text_rlhf-and-dpo-on-snowflake_0":{"id":"text-697310d581","text":"\u003Cp\u003EFür Unternehmens-Teams sind RLHF und DPO nicht nur Methoden zum Modelltraining. Sie stellen auch eine Herausforderung für das Datenmanagement dar. Präferenzpaare, Entscheidungen von Annotator:innen, Prompt-Versionen, Ausgaben von Reward-Modellen, Trainingsläufe und ausgerichtete Modellversionen werden allesamt zu Artefakten, die kontrolliert, nachverfolgt und überprüft werden müssen.\u003C/p\u003E\r\n\u003Cp\u003E\u003Ca href=\"https://www.snowflake.com/de/product/features/end-to-end-ml-workflows/\"\u003ESnowflake&nbsp;ML\u003C/a\u003E bietet Funktionen, die End-to-End-ML-Workflows mit kontrollierten Daten unterstützen, einschließlich Datenvorbereitung, Modelltraining, Experimenten, Pipelines, Bereitstellung und Monitoring. Dies ist für RLHF und DPO wertvoll, da die Präferenzdaten selbst sensibel oder reguliert sein können. Annotator-Rankings können Prompts, generierte Antworten, Notizen von Prüfer:innen, Richtlinienentscheidungen und Beispiele für unerwünschtes Modellverhalten umfassen. Die Verwaltung dieser Daten in Snowflake kann Teams dabei helfen, dieselben Governance-Muster anzuwenden, die sie für andere Unternehmensdaten-Assets verwenden, einschließlich Zugriffskontrollen, Auditierbarkeit und Lineage.\u003C/p\u003E\r\n\u003Cp\u003E\u003Ca href=\"https://docs.snowflake.com/de/developer-guide/snowflake-ml/container-runtime-ml\"\u003ESnowflakes Container Runtime für ML\u003C/a\u003E kann benutzerdefinierte ML-Workloads unterstützen, einschließlich Modelltraining, Hyperparameter-Anpassung, Batch-Inferenz und Fine-Tuning, unter Verwendung von CPU- oder GPU-Rechenressourcen-Pools. Für RLHF- oder DPO-Workflows kann diese Umgebung benutzerdefinierten Trainingscode und Open Source-ML-Frameworks unterstützen, während der Trainingsprozess nah an den kontrollierten Daten bleibt.\u003C/p\u003E\r\n\u003Cp\u003EDie \u003Ca href=\"https://docs.snowflake.com/de/developer-guide/snowflake-ml/model-registry/overview\"\u003ESnowflake Model Registry\u003C/a\u003E kann Teams dann dabei helfen, die Modell-Artefakte zu verwalten, die RLHF und DPO erzeugen. Ein vollständiger Alignment-Workflow kann das ursprüngliche Basismodell, das Modell mit überwachter Feinanpassung, ein oder mehrere Reward-Modelle, DPO-angepasste Varianten und finale Policy-Modelle umfassen, die für die Bereitstellung ausgewählt wurden. Die Model Registry von Snowflake wurde entwickelt, um Modelle und Metadaten sicher zu verwalten.\u003C/p\u003E\r\n\u003Cp\u003ELineage ist in diesem Zusammenhang besonders wichtig. Snowflake ML Lineage kann Beziehungen zwischen Quelltabellen, Feature-Views, Datasets, registrierten Modellen und bereitgestellten Modelldiensten nachverfolgen und Teams dabei helfen, Fragen zu beantworten, wie z. B. woher die Trainingsdaten stammen und welche Dienste ein Modell verwenden. Diese Art von Transparenz kann Teams dabei helfen, ein ausgerichtetes Modell wieder mit den Präferenzdaten, dem Reward-Modell und dem Trainingslauf zu verknüpfen, die sein Verhalten geprägt haben.\u003C/p\u003E\r\n","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"title_enterprise-model-training-depends-on-governed-feedback-loops":{"id":"title-v2-9545da1832","additionalClasses":"anchor-title anchor-title--enterprise-model-training-depends-on-governed-feedback-loops","type":"heading2","lines":["Modelltraining in Unternehmen hängt von kontrollierten Feedbackschleifen ab"],":type":"snowflake-site/components/title-v2"},"text_enterprise-model-training-depends-on-governed-feedback-loops_0":{"id":"text-48ef17a888","text":"\u003Cp\u003ERLHF hat die Entwicklung der \u003Ca href=\"https://www.snowflake.com/en/fundamentals/generative-ai/\"\u003Egenerativen KI\u003C/a\u003E verändert, weil es Modellentwickler:innen eine Möglichkeit bot, für Präferenzen zu trainieren, die schwer als Regeln zu kodieren sind. Es trug dazu bei, Sprachmodelle von Systemen, die fließenden Text generieren konnten, zu Systemen weiterzuentwickeln, die Anweisungen befolgen, hilfreicher antworten und menschliche Erwartungen an das Konversationsverhalten besser widerspiegeln.\u003C/p\u003E\r\n\u003Cp\u003EAber RLHF zeigt auch, warum Alignment kein einzelner Trainingsschritt ist. Ein Präferenz-Label spiegelt ein Urteil wider, und ein Reward-Modell nähert sich diesem Urteil an. Ein Policy-Optimization-Durchlauf drängt das Modell in Richtung dieser Annäherung. Jede Ebene kann das Modell verbessern, aber jede Ebene erzeugt auch Nachweise, die \u003Ca href=\"https://www.snowflake.com/en/artificial-intelligence/ai-governance/model-governance/\"\u003Ekontrolliert\u003C/a\u003E werden müssen: wer die Daten gekennzeichnet hat, welche Kriterien verwendet wurden, welche Modellversion trainiert wurde, wie sich das Reward-Modell verhalten hat und ob sich die endgültige Policy bei der Evaluierung tatsächlich verbessert hat.\u003C/p\u003E\r\n\u003Cp\u003EFür Unternehmen ist das ausgerichtete Modell nur ein Ergebnis der RLHF-Pipeline. Das andere Ergebnis ist eine Aufzeichnung darüber, wie menschliche Präferenzen zum Modellverhalten wurden – und ob das Unternehmen diesen Pfad überprüfen, reproduzieren und verwalten kann, wenn das Modell in die Produktion übergeht.\u003C/p\u003E\r\n","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"callout_enterprise-model-training-depends-on-governed-feedback-loops_0":{"id":"text-e49e7b9f2d","additionalClasses":"callout callout--general","text":"\u003Cp\u003E\u003Cstrong\u003EWICHTIGSTE ERKENNTNIS\u003C/strong\u003E\u003C/p\u003E\n\u003Cp\u003ERLHF hilft Sprachmodellen, nützlichere, vertrauenswürdigere und anweisungsbefolgende Antworten zu generieren, indem sie aus menschlichen Präferenzen lernen. Für Unternehmen hängt der Erfolg nicht nur von der Erfassung hochwertigen Feedbacks ab, sondern auch von der Verwaltung der Daten, Modelle und Trainingsprozesse, die diese Präferenzen in produktives KI-Verhalten umwandeln.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-regular text-color-text-05"}},":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container","appliedCssClassNames":"snowflake-responsive-container-inner-padding-medium"},"flexible_column_content_container_2":{"additionalClasses":"hub-sidebar","layout":"SIMPLE","id":"hub-body-aside",":itemsOrder":["container"],":items":{"container":{"additionalClasses":"sticky-sidebar","columnClassNames":{"text_943981956_copy_":"aem-GridColumn aem-GridColumn--default--12","text_copy":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","layout":"RESPONSIVE_GRID","columnCount":12,"id":"container-11cc7e3fe6",":itemsOrder":["text_943981956_copy_","text_copy"],":items":{"text_943981956_copy_":{"id":"text-9016737281","additionalClasses":"eyebrow-text","text":"\u003Cp\u003EIn diesem Leitfaden\u003C/p\u003E\n","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-regular"},"text_copy":{"id":"text-449ddc527c","additionalClasses":"page-toc","text":"\u003Cul\u003E\u003Cli data-anchor=\"what-is-rlhf\"\u003EWas ist RLHF?\u003C/li\u003E\u003Cli data-anchor=\"how-the-rlhf-pipeline-works\"\u003ESo funktioniert die RLHF-Pipeline\u003C/li\u003E\u003Cli data-anchor=\"challenges-and-alternatives-to-rlhf\"\u003EHerausforderungen und Alternativen zu RLHF\u003C/li\u003E\u003Cli data-anchor=\"rlhf-and-dpo-on-snowflake\"\u003ERLHF und DPO bei Snowflake\u003C/li\u003E\u003Cli data-anchor=\"enterprise-model-training-depends-on-governed-feedback-loops\"\u003EModelltraining in Unternehmen hängt von kontrollierten Feedbackschleifen ab\u003C/li\u003E\u003C/ul\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-small text-color-text-05"}},":type":"snowflake-site/components/container","appliedCssClassNames":"snowflake-responsive-container-inner-padding-medium"}},":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container","appliedCssClassNames":"snowflake-responsive-container-inner-padding-small"},"isActiveTOC":false,"isBlogPage":false,":type":"snowflake-site/components/flexible-column-container"},"flexible_column_cont_1786318617":{"id":"flexible-column-container-17cfff5ae6","propertiesId":"hub-faq","type":"2-column-40-60","alignColumns":"top","containerMaxWidth":"extra-large","topPadding":"large","bottomPadding":"large","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"backgroundImageOption":"none","flexible_column_content_container_1":{"layout":"SIMPLE","id":"hub-faq-intro",":itemsOrder":["title_v2_copy","text_copy"],":items":{"title_v2_copy":{"id":"title-v2-47c5bdad5a","additionalClasses":"hub-faq__headline","type":"heading2","lines":["Häufig gestellte Fragen"],":type":"snowflake-site/components/title-v2","appliedCssClassNames":"left-alignment"},"text_copy":{"id":"text-0e3cf1df8b","additionalClasses":"hub-faq__subheadline","text":"\u003Cp\u003EIhre häufigsten Fragen zu RLHF, beantwortet von Snowflake-Expert:innen.\u003C/p\u003E\n","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"}},":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container","appliedCssClassNames":"snowflake-responsive-container-inner-padding-extra-small"},"flexible_column_content_container_2":{"layout":"SIMPLE","id":"hub-faq-accordions",":itemsOrder":["simple_snowflake_acc"],":items":{"simple_snowflake_acc":{"id":"simple-snowflake-accordion-71f0eafe60","additionalClasses":"seo-hub__faqs","showDivider":false,"accordionItemsList":[{"title":"Warum ist RLHF für Sprachmodelle wichtig?","richText":"\u003Cp\u003ERLHF hilft Sprachmodellen, über die reine Generierung von fließendem Text hinauszugehen. Es bietet Entwickler:innen eine Möglichkeit, Modelle für Eigenschaften zu trainieren, die mit festen Regeln schwer zu definieren sind, wie z. B. Hilfsbereitschaft, Tonalität, Relevanz, Unbedenklichkeit und die Fähigkeit, der Absicht der Nutzer:innen zu folgen.\u003C/p\u003E"},{"title":"Ist RLHF dasselbe wie überwachte Feinanpassung?","richText":"\u003Cp\u003EDie überwachte Feinanpassung trainiert ein Modell, indem ihm Beispiele für gute Antworten gezeigt werden. RLHF fügt eine weitere Ebene hinzu, indem es dem Modell beibringt, welche Antwort Menschen bevorzugen, wenn mehrere Antworten möglich sind. Dies hilft dem Modell, ein nuancierteres Verhalten zu erlernen, als es Beispiele allein bieten können.\u003C/p\u003E"},{"title":"Was ist ein Reward-Modell bei RLHF?","richText":"\u003Cp\u003EEin Reward-Modell ist ein Modell, das darauf trainiert ist, vorherzusagen, welche Ausgaben Menschen wahrscheinlich bevorzugen. Es nimmt einen Prompt und eine Antwort als Eingabe und gibt eine Bewertung zurück. Während des RLHF wird das Sprachmodell dahingehend optimiert, Antworten zu generieren, die bessere Bewertungen durch das Reward-Modell erhalten.\u003C/p\u003E"},{"title":"Was sind die größten Herausforderungen bei RLHF?","richText":"\u003Cp\u003EZu den größten Herausforderungen gehören die Erfassung hochwertiger Präferenzdaten, die Konsistenz des Feedbacks, die Vermeidung von Bias bei menschlichen Bewertungen, die Verhinderung von Reward Hacking und die Bewältigung der Komplexität der Reinforcement-Learning-Optimierung. In Unternehmensumgebungen müssen Teams außerdem Präferenzdaten, Modellversionen, Trainingsdurchläufe und Evaluierungsergebnisse verwalten.\u003C/p\u003E"},{"title":"Was ist Reward Hacking?","richText":"\u003Cp\u003EReward Hacking tritt auf, wenn ein Modell lernt, Schwächen im Reward-Modell auszunutzen, anstatt sich wirklich zu verbessern. Beispielsweise könnte es Antworten generieren, die laut der Reward-Bewertung gut aussehen, aber für die Nutzer:innen nicht tatsächlich nützlicher, genauer oder angemessener sind.\u003C/p\u003E"}],":type":"snowflake-site/components/simple-snowflake-accordion"}},":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container"},"isActiveTOC":false,"isBlogPage":false,":type":"snowflake-site/components/flexible-column-container","appliedCssClassNames":"snowflake-flexible-column-container-gray-10-bg"},"flexible_column_cont_1467213961":{"id":"flexible-column-container-df66d9c48f","propertiesId":"hub-explore-resources-header","type":"1-column","alignColumns":"top","containerMaxWidth":"extra-large","topPadding":"large","bottomPadding":"none","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"backgroundImageOption":"none","flexible_column_content_container_1":{"layout":"SIMPLE","id":"container-8bd5de9967",":itemsOrder":["title_v2"],":items":{"title_v2":{"id":"title-v2-783780b2bb","additionalClasses":"hub-explore-resources-header__headline","type":"heading2","lines":["KI-Ressourcen entdecken"],":type":"snowflake-site/components/title-v2","appliedCssClassNames":"left-alignment"}},":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container"},"isActiveTOC":false,"isBlogPage":false,":type":"snowflake-site/components/flexible-column-container","appliedCssClassNames":"snowflake-flexible-column-container-gray-10-bg"},"flexible_column_cont_912630531":{"id":"flexible-column-container-8c75afc89e","propertiesId":"hub-explore-resources-grid","type":"1-column","alignColumns":"top","containerMaxWidth":"extra-large","topPadding":"small","bottomPadding":"large","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"backgroundImageOption":"none","flexible_column_content_container_1":{"layout":"SIMPLE","id":"hub-explore-resources-grid-inner",":itemsOrder":["resource_chip_0","resource_chip_1","resource_chip_2","resource_chip_3"],":items":{"resource_chip_0":{"id":"content-chip-c80821d619","tagText":"LEITFADEN","tagColor":"#AAE5EA","cta":{"id":"cta","showOutboundIcon":false,"buttonLink":{"valid":true,"url":"https://www.snowflake.com/en/developers/guides/intro-to-machine-learning-with-snowpark-ml-for-python/"},"linkTargetContentType":"GENERIC",":type":"snowflake-site/components/button","linkType":"SNOWFLAKE_EXTERNAL","text":"Mehr erfahren"},"headline":{"id":"title","type":"heading5","lines":["Getting Started with ML Development in Snowflake"],":type":"snowflake-site/components/title-v2"},":type":"snowflake-site/components/content-chip","appliedCssClassNames":"snowflake-content-chip-white-bg"},"resource_chip_1":{"id":"content-chip-bb635e109f","tagText":"LEITFADEN","tagColor":"#AAE5EA","cta":{"id":"cta","showOutboundIcon":false,"buttonLink":{"valid":true,"url":"https://www.snowflake.com/en/developers/guides/snowpark-container-services-model-serving-guide/"},"linkTargetContentType":"GENERIC",":type":"snowflake-site/components/button","linkType":"SNOWFLAKE_EXTERNAL","text":"Mehr erfahren"},"headline":{"id":"title","type":"heading5","lines":["Model Serving in Snowpark Container Services"],":type":"snowflake-site/components/title-v2"},":type":"snowflake-site/components/content-chip","appliedCssClassNames":"snowflake-content-chip-white-bg"},"resource_chip_2":{"id":"content-chip-3ed77b9474","tagText":"BLOG","tagColor":"#29B5E8","cta":{"id":"cta","showOutboundIcon":false,"buttonLink":{"valid":true,"url":"https://www.snowflake.com/en/blog/engineering/scalable-model-serving-architecture/"},"linkTargetContentType":"GENERIC",":type":"snowflake-site/components/button","linkType":"SNOWFLAKE_EXTERNAL","text":"Mehr erfahren"},"headline":{"id":"title","type":"heading5","lines":["Scalable Model Serving: An Architectural Overview"],":type":"snowflake-site/components/title-v2"},":type":"snowflake-site/components/content-chip","appliedCssClassNames":"snowflake-content-chip-white-bg"},"resource_chip_3":{"id":"content-chip-fed9a9b6f2","tagText":"BLOG","tagColor":"#29B5E8","cta":{"id":"cta","showOutboundIcon":false,"buttonLink":{"valid":true,"url":"https://www.snowflake.com/en/blog/engineering/snowflake-ml-runtime-vs-databricks-tpcx-ai/"},"linkTargetContentType":"GENERIC",":type":"snowflake-site/components/button","linkType":"SNOWFLAKE_EXTERNAL","text":"Mehr erfahren"},"headline":{"id":"title","type":"heading5","lines":["Accelerating Distributed Training with Snowflake ML"],":type":"snowflake-site/components/title-v2"},":type":"snowflake-site/components/content-chip","appliedCssClassNames":"snowflake-content-chip-white-bg"}},":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container"},"isActiveTOC":false,"isBlogPage":false,":type":"snowflake-site/components/flexible-column-container","appliedCssClassNames":"snowflake-flexible-column-container-gray-10-bg"},"flexible_column_cont_1158003461":{"id":"flexible-column-container-fea4c631eb","propertiesId":"hub-explore-topics-header","type":"1-column","alignColumns":"top","containerMaxWidth":"extra-large","topPadding":"large","bottomPadding":"none","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"backgroundImageOption":"none","flexible_column_content_container_1":{"layout":"SIMPLE","id":"container-7fb6e498b3",":itemsOrder":["title_v2_copy_copy","text_copy_copy"],":items":{"title_v2_copy_copy":{"id":"title-v2-ae88b56141","additionalClasses":"hub-explore-topics-header__headline","type":"heading2","lines":["KI-Themen entdecken"],":type":"snowflake-site/components/title-v2","appliedCssClassNames":"left-alignment"},"text_copy_copy":{"id":"text-84aff974ff","additionalClasses":"hub-explore-topics-header__subheadline","text":"\u003Cp\u003EDetaillierte Einblicke in jeden Aspekt der künstlichen Intelligenz\u003C/p\u003E\n","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"}},":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container","appliedCssClassNames":"snowflake-responsive-container-inner-padding-extra-small"},"isActiveTOC":false,"isBlogPage":false,":type":"snowflake-site/components/flexible-column-container","appliedCssClassNames":"snowflake-flexible-column-container-white-bg"},"flexible_column_cont_1377146023":{"id":"flexible-column-container-8d4759744f","propertiesId":"hub-explore-topics-grid","type":"3-column-even","alignColumns":"top","containerMaxWidth":"extra-large","topPadding":"small","bottomPadding":"large","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"backgroundImageOption":"none","flexible_column_content_container_1":{"layout":"SIMPLE","id":"container-bd87d9088f",":itemsOrder":["topic_card_0"],":items":{"topic_card_0":{"id":"card-v2-53415b57ce","configurationStatus":{"configured":true,"message":""},"type":"content-card","text":{"id":"text","text":"\u003Cp\u003EOperationalisieren und verwalten Sie den Lebenszyklus für maschinelles Lernen in großem Maßstab.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text"},"layoutStyle":"vertical","title":{"id":"title","type":"heading4","lines":["MLOps"],":type":"snowflake-site/components/title-v2"},"button":{"id":"button","showOutboundIcon":false,"buttonLink":{"valid":true,"url":"/de/artificial-intelligence/machine-learning/mlops/"},"linkTargetContentType":"GENERIC",":type":"snowflake-site/components/button","linkType":"SNOWFLAKE_INTERNAL","text":"Mehr erfahren"},":type":"snowflake-site/components/card-v2"}},":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container"},"flexible_column_content_container_2":{"layout":"SIMPLE","id":"container-300cde57fe",":itemsOrder":["topic_card_1"],":items":{"topic_card_1":{"id":"card-v2-ec851b6cde","configurationStatus":{"configured":true,"message":""},"type":"content-card","text":{"id":"text","text":"\u003Cp\u003EWie LLMs funktionieren und welche Rolle sie in der Unternehmens-KI spielen.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text"},"layoutStyle":"vertical","title":{"id":"title","type":"heading4","lines":["Large Language Models"],":type":"snowflake-site/components/title-v2"},"button":{"id":"button","showOutboundIcon":false,"buttonLink":{"valid":true,"url":"/de/fundamentals/large-language-model/"},"linkTargetContentType":"GENERIC",":type":"snowflake-site/components/button","linkType":"SNOWFLAKE_INTERNAL","text":"Mehr erfahren"},":type":"snowflake-site/components/card-v2"}},":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container"},"flexible_column_content_container_3":{"layout":"SIMPLE","id":"container-d0b452c1ed",":itemsOrder":["topic_card_2"],":items":{"topic_card_2":{"id":"card-v2-fe52d0bbaf","configurationStatus":{"configured":true,"message":""},"type":"content-card","text":{"id":"text","text":"\u003Cp\u003EDie Grundlagen der generativen KI und ihre geschäftlichen Auswirkungen.\u003C/p\u003E\r\n","richText":true,":type":"snowflake-site/components/text"},"layoutStyle":"vertical","title":{"id":"title","type":"heading4","lines":["Generative KI"],":type":"snowflake-site/components/title-v2"},"button":{"id":"button","showOutboundIcon":false,"buttonLink":{"valid":true,"url":"/en/fundamentals/generative-ai-architecture-models-applications/"},"linkTargetContentType":"GENERIC",":type":"snowflake-site/components/button","linkType":"SNOWFLAKE_INTERNAL","text":"Mehr erfahren"},":type":"snowflake-site/components/card-v2"}},":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container"},"isActiveTOC":false,"isBlogPage":false,":type":"snowflake-site/components/flexible-column-container","appliedCssClassNames":"snowflake-flexible-column-container-white-bg"},"flexible_column_cont_topics_row2":{"id":"flexible-column-container-f0b50b8197","propertiesId":"hub-explore-topics-grid-row2","type":"3-column-even","alignColumns":"top","containerMaxWidth":"extra-large","topPadding":"none","bottomPadding":"large","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"backgroundImageOption":"none","isActiveTOC":false,"isBlogPage":false,":type":"snowflake-site/components/flexible-column-container","appliedCssClassNames":"snowflake-flexible-column-container-white-bg"}},":type":"wcm/foundation/components/responsivegrid"},"modal_container":{"layout":"SIMPLE","id":"container-cdc2ce0507",":itemsOrder":[],":items":{},":type":"snowflake-site/components/modal/modal-container"},"markup_editor_928258845":{"id":"markup-editor-7ed39f9fa6","title":" ","cssContent":".snowflake-flexible-column-container-gray-10-bg\u003E.snowflake-flexible-column-container{background-color:var(--ui-background-05) !important}.text-size-regular:has(.seo-hub-hero__related-topic-label){display:flex;align-items:center}.hub-hero__headline span{text-transform:none !important}.hub-hero__subheadline p{max-width:70ch;margin-top:8px}.hub-hero__authors \u003E .container \u003E .cmp-container \u003E .aem-container{display:flex;flex-direction:row}.hub-hero__authors \u003E .container \u003E .cmp-container \u003E .aem-container \u003E div{width:auto !important;margin:24px 48px 0 0 !important}.hub-hero__authors .heading-5-v2{gap:var(--spacing-00)}.hub-hero__authors .snowflake-content-chip-button{display:none !important}.hub-hero__authors .snowflake-person-chip-content .body-2,.hub-hero__authors .snowflake-content-chip-content .snowflake-title-v2-line{font-size:16px !important;line-height:20px !important;font-family:\"Lato\",sans-serif !important;color:#000 !important;font-weight:600 !important}.hub-hero__authors .snowflake-person-chip-content .body-3,.hub-hero__authors .snowflake-content-chip-content .snowflake-title-v2-line:not(:first-child){font-weight:400 !important;color:var(--text-05) !important;font-size:16px !important}.hub-hero__authors .snowflake-image-container img{aspect-ratio:1 !important;border-radius:100%;overflow:hidden}.hub-hero__authors .snowflake-person-chip-avatar{width:56px;height:56px}.hub-hero__authors .snowflake-content-chip{align-items:center;display:inline-flex}.hub-hero__authors .snowflake-content-chip-image{max-width:56px;line-height:0;margin-right:var(--spacing-03)}.hub-hero__authors .snowflake-person-chip-inner-horizontal{gap:var(--spacing-03)}@media screen and (min-width:1367px){.hub-hero__headline .heading-1-v2{font-size:48px;line-height:44px}}#hub-explore-resources-grid-inner\u003E.container\u003E.cmp-container\u003E.aem-container{display:flex;flex-direction:row;flex-wrap:wrap;gap:24px}#hub-explore-resources-grid-inner\u003E.container\u003E.cmp-container\u003E.aem-container::before,#hub-explore-resources-grid-inner\u003E.container\u003E.cmp-container\u003E.aem-container::after{display:none}#hub-explore-resources-grid-inner\u003E.container\u003E.cmp-container\u003E.aem-container\u003Ediv{width:calc(25% - 18px)}.text-color-text-05 .snowflake-text h2,.text-color-text-05.cq-Editable-dom h2,.text-color-text-05 .snowflake-text h3,.text-color-text-05.cq-Editable-dom h3,.text-color-text-05 .snowflake-text h4,.text-color-text-05.cq-Editable-dom h4,.text-color-text-05 .snowflake-text h5,.text-color-text-05.cq-Editable-dom h5,.text-color-text-05 .snowflake-text h6,.text-color-text-05.cq-Editable-dom h6{color:#000 !important}","isGSAPEnabled":false,":type":"snowflake-site/components/markup-editor"},"markup_editor_597730182":{"id":"markup-editor-387836ef83","title":" ","cssContent":".sf-copy-markdown [data-copy-md]{display:inline-flex;align-items:center;gap:6px;padding:8px 16px;font-family:'Texta',sans-serif;text-transform:uppercase;font-weight:800 !important;font-size:14px;font-weight:500;color:#11567f;background:#f0faff;border:1px solid #b8e6f9;border-radius:24px;cursor:pointer;transition:background .2s ease,border-color .2s ease,color .2s ease}.sf-copy-markdown [data-copy-md]:hover{background:#ddf3fc;border-color:#29b5e8}.sf-copy-markdown [data-copy-md][data-copied=\"1\"]{color:#0f7b3e;background:#ecfdf5;border-color:#6ee7a0;pointer-events:none}.sf-copy-markdown [data-copy-md] svg{flex-shrink:0}.longform-conten .snowflake-content-chip-white-bg .snowflake-content-chip{box-shadow:0 0 24px 4px rgba(0,0,0,.02),0 4px 8px 0 rgba(0,0,0,.04);flex-direction:row-reverse;align-items:center}.longform-conten .snowflake-content-chip-button{display:none}.longform-conten .snowflake-content-chip-image__inner{aspect-ratio:5 / 3;display:flex;justify-content:center;align-items:center;background-color:var(--ui-01);border-radius:4px}.longform-conten .snowflake-content-chip-image{margin-right:0;margin-left:48px}.longform-conten .snowflake-content-chip-image img{width:50%;border-radius:0 !important;object-fit:contain}.longform-content .black-blue-text-color .snowflake-title-v2-line:not(:first-child){font-size:14px !important;font-weight:400 !important;color:rgba(0,0,0,.6) !important;margin-top:8px !important}.page-toc ul li:first-child{padding-top:0 !important}.page-toc ul li:last-child{padding-bottom:0 !important}.seo-hub__top-bar \u003E .container \u003E .cmp-container \u003E .aem-container \u003E div:first-child{flex-grow:1}.sf-copy-markdown{margin-top:40px !important}.page-toc ul{margin-top:16px !important}.seo-hub__top-bar \u003E .container \u003E .cmp-container \u003E .aem-container{display:flex;justify-content:space-between}.sf-copy-markdown{}.callout.snowflake-text p:not(:first-child){margin-top:var(--spacing-01)}.callout \u003E span \u003E p:first-child \u003E strong,.callout \u003E span \u003E p:first-child \u003E b{text-transform:uppercase;font-family:'Texta',sans-serif;font-size:16px !important;color:var(--ui-01) !important}.seo-hub-hero__subheadline p{max-width:50ch}.tag-group ul{list-style-type:none;padding:0;margin:0;display:flex;flex-direction:row;row-gap:12px;column-gap:8px;align-items:center;flex-wrap:wrap}.tag-group ul li:first-child{flex-shrink:0}.tag-group ul li a{display:inline-block;padding:2px 12px;border-radius:48px;background-color:#ededed;color:#666;font-size:14px !important}@media screen and (min-width:1367px){.seo-hub-hero__headline span.snowflake-title-v2-line{font-size:56px !important}}.callout.snowflake-text p:not(:first-child){margin-top:var(--spacing-01)}.callout \u003E span \u003E p:first-child \u003E b{text-transform:uppercase;font-family:'Texta',sans-serif;font-size:16px !important;color:var(--ui-01) !important}.seo-hub-hero__subheadline p{max-width:80ch}#hero:has(.snowflake-youtube-lite) .seo-hub-hero__subheadline p{max-width:50ch}.tag-group ul{list-style-type:none;padding:0;margin:0;display:flex;flex-direction:row;row-gap:12px;column-gap:8px;align-items:center;flex-wrap:wrap}.tag-group ul li:first-child{width:100%;flex-shrink:0}.tag-group ul li a{display:inline-block;padding:2px 12px;border-radius:48px;background-color:#ededed;color:#666;font-size:14px !important}@media screen and (min-width:1367px){.seo-hub-hero__headline span.snowflake-title-v2-line{font-size:56px !important}}","isGSAPEnabled":false,":type":"snowflake-site/components/markup-editor"},"markup_editor":{"id":"markup-editor-5c35b9b40f","title":" ","cssContent":"div.snowflake-breadcrumb a.snowflake-breadcrumb-item,.snowflake-breadcrumb div.snowflake-breadcrumb-item{text-transform:none;font-weight:500}.snowflake-breadcrumb svg{display:none !important}.snowflake-breadcrumb a:has(svg)::after{content:'/';margin:0 12px;color:#666}.hub-sidebar{padding:0 40px}.sticky-sidebar{max-width:340px;margin-left:auto}.page-toc ul{list-style-type:none;padding:0}.page-toc li{padding:8px 16px;border-left:4px solid var(--ui-01);cursor:pointer;transition:300ms ease all}.page-toc li:hover{color:var(--ui-01);border-color:#7fd3f1;transition:300ms ease all}.callout,.customer-card{background-color:#eef9fd;border-left:4px solid var(--ui-01);padding:24px 24px 24px 32px;border-radius:4px}.logo-container{max-width:180px}.longform-content li{margin-top:1rem !important}div.longform-content p{max-width:80ch}.bolder .snowflake-title-v2-line{font-weight:900 !important}.border-top\u003Ediv{border-top:1px solid #ccc;padding-top:48px}.related-topics ul{list-style-type:none;padding:0;margin:0;display:flex;gap:8px;flex-wrap:wrap}.related-topics li{display:inline-block;border:1px solid #ccc;padding:4px 12px;border-radius:24px}div.longform-content .snowflake-text h2,div.longform-content .snowflake-text .heading-2-v2,div.longform-content .snowflake-text h3,div.longform-content .snowflake-text .heading-3-v2,div.longform-content .snowflake-title-v2 .heading-3-v2,div.longform-content .snowflake-text h4,div.longform-content .snowflake-text .heading-4-v2,div.longform-content .snowflake-title-v2 .heading-4-v2,div.longform-content .snowflake-text h5,div.longform-content .snowflake-text .heading-5-v2,div.longform-content .snowflake-title-v2 .heading-5-v2,div.longform-content .snowflake-text h6,div.longform-content .snowflake-title-v2 .heading-6-v2,div.longform-content .snowflake-text .heading-6-v2{text-transform:none !important}div.longform-content .snowflake-text h2,div.longform-content .snowflake-text .heading-2-v2,div.longform-content .snowflake-text h3,div.longform-content .snowflake-text .heading-3-v2,div.longform-content .snowflake-text h4,div.longform-content .snowflake-text .heading-4-v2,div.longform-content .snowflake-text h5,div.longform-content .snowflake-text .heading-5-v2,div.longform-content .snowflake-text h6,div.longform-content .snowflake-text .heading-6-v2{margin-top:1.5rem !important;line-height:1.1 !important}div.longform-content .snowflake-text h3,div.longform-content .snowflake-text .heading-3-v2,div.longform-content .snowflake-title-v2 .heading-3-v2,div.longform-content .snowflake-text h4,div.longform-content .snowflake-text .heading-4-v2,div.longform-content .snowflake-title-v2 .heading-4-v2,div.longform-content .snowflake-text h5,div.longform-content .snowflake-text .heading-5-v2,div.longform-content .snowflake-title-v2 .heading-5-v2,div.longform-content .snowflake-text h6,div.longform-content .snowflake-text .heading-6-v2,div.longform-content .snowflake-title-v2 .heading-6-v2{font-family:Lato,sans-serif !important;font-weight:800 !important}div.longform-content .snowflake-text h2,div.longform-content .snowflake-text .heading-2-v2,div.longform-content .snowflake-title-v2 .heading-2-v2{text-transform:none !important;font-size:28px !important}div.longform-content .snowflake-text h3,div.longform-content .snowflake-text .heading-3-v2,div.longform-content .snowflake-title-v2 .heading-3-v2{font-size:22px !important}div.longform-content .snowflake-text h4,div.longform-content .snowflake-text .heading-4-v2,div.longform-content .snowflake-title-v2 .heading-4-v2{font-size:18px !important}div.longform-content .snowflake-text h5,div.longform-content .snowflake-text .heading-5-v2,div.longform-content .snowflake-title-v2 .heading-5-v2{font-size:16px !important}div.longform-content .snowflake-text h6,div.longform-content .snowflake-text .heading-6-v2,div.longform-content .snowflake-title-v2 .heading-6-v2{font-size:14px !important}@media screen and (min-width:992px){div.longform-content .snowflake-text h2,div.longform-content .snowflake-text .heading-2-v2,div.longform-content .snowflake-title-v2 .heading-2-v2{font-size:38px !important}div.longform-content .snowflake-text h3,div.longform-content .snowflake-text .heading-3-v2,div.longform-content .snowflake-title-v2 .heading-3-v2{font-size:26px !important}div.longform-content .snowflake-text h4,div.longform-content .snowflake-text .heading-4-v2,div.longform-content .snowflake-title-v2 .heading-4-v2{font-size:22px !important}div.longform-content .snowflake-text h5,div.longform-content .snowflake-text .heading-5-v2,div.longform-content .snowflake-title-v2 .heading-5-v2{font-size:18px !important}div.longform-content .snowflake-text h6,div.longform-content .snowflake-text .heading-6-v2,div.longform-content .snowflake-title-v2 .heading-6-v2{font-size:16px !important}}.sticky-sidebar .page-toc li.is-active{font-weight:600;color:var(--snow-blue,#29b5e8)}.sticky-sidebar .page-toc li[data-anchor]{cursor:pointer}.longform-content table{margin-top:24px;margin-bottom:24px;width:100%;background-color:var(--ui-background-01);border-collapse:collapse;border:2px solid var(--ui-background-09);font-family:'Lato',sans-serif;color:var(--ui-background-09)}.longform-content table thead{background-color:var(--ui-01)}.longform-content th,.longform-content td{min-width:120px;border:2px solid var(--ui-background-09);padding:var(--spacing-01)}.longform-content ol{margin-top:0 !important}.longform-content ol li{margin-bottom:1rem !important}.longform-content ul li{margin:0;padding:0 0 0 32px;position:relative}.longform-content ul{list-style-type:none}.longform-content ul li::before{content:\"\";display:block;border-radius:100%;background:#29b5e8;width:18px;height:18px;position:absolute;top:4px;left:0;border:5px solid #e5f2f7;box-sizing:border-box}.seo-customer.snowflake-card-v2-advanced-horizontal .snowflake-card-v2-advanced-image-container{max-width:200px}.seo-customer.snowflake-card-v2-advanced-horizontal .snowflake-card-v2-advanced-image-container img{object-fit:contain}.related-topics-outer-container \u003E .container \u003E .cmp-container \u003E .aem-container{display:flex;flex-direction:row}.related-topics-outer-container \u003E .container \u003E .cmp-container \u003E .aem-container \u003E div{width:auto !important;margin:0 !important}.related-topics-outer-container \u003E .container \u003E .cmp-container \u003E .aem-container \u003E div:first-child{margin-right:16px !important;flex-shrink:0}","jsContent":"(function(){var OFFSET=100;if(window.gsap&&window.ScrollTrigger){gsap.registerPlugin(ScrollTrigger);var sidebar=document.querySelector('.sticky-sidebar');var body=document.querySelector('.longform-content');if(sidebar&&body){ScrollTrigger.create({trigger:sidebar,start:'top 100px',endTrigger:body,end:'bottom bottom',pin:sidebar,pinSpacing:false});}}document.addEventListener('click',function(e){var li=e.target.closest('li[data-anchor]');if(!li)return;var slug=li.getAttribute('data-anchor');var heading=document.querySelector('.anchor-title--'+CSS.escape(slug));if(!heading)return;e.preventDefault();var top=heading.getBoundingClientRect().top+window.pageYOffset-OFFSET;window.scrollTo({top:top,behavior:'smooth'});history.replaceState(null,'','#'+slug);},false);var headings=document.querySelectorAll('[class*=\"anchor-title--\"]');if(headings.length&&'IntersectionObserver'in window){var io=new IntersectionObserver(function(entries){entries.forEach(function(entry){if(!entry.isIntersecting)return;var cls=Array.from(entry.target.classList).find(function(c){return c.indexOf('anchor-title--')===0;});if(!cls)return;var slug=cls.replace('anchor-title--','');document.querySelectorAll('li[data-anchor]').forEach(function(li){li.classList.toggle('is-active',li.getAttribute('data-anchor')===slug);});});},{rootMargin:'-20% 0px -70% 0px',threshold:0});headings.forEach(function(h){io.observe(h);});}})();","isGSAPEnabled":true,":type":"snowflake-site/components/markup-editor"},"experiencefragment-footer":{"id":"experiencefragment-1d35446f06","localizedFragmentVariationPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/footer/master/jcr:content","configured":true,"xfModelPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/footer/master.xfmodel.json",":type":"snowflake-site/components/experiencefragment"},"experiencefragment":{"id":"experiencefragment-1d8a64b127","localizedFragmentVariationPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/footer-legal-disclaimers/master/jcr:content","configured":true,"xfModelPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/footer-legal-disclaimers/master.xfmodel.json",":type":"snowflake-site/components/experiencefragment"}},":type":"wcm/foundation/components/responsivegrid"}},"coveoConfig":{"pipeline":"snowflake.com","apiKey":"xx335921a6-2a0a-40f2-a167-e390b4766c3d","organizationId":"snowflakecomputingproduction8neljofn","searchHub":"snowflake.com"},"analyticsDebugMode":false,"analyticsData":{"excludeFromAnalytics":false,"subCategory":"","pageType":"homepage","templateName":"base-page-template54","siteName":"snowflake","pageUrl":"/content/snowflake-site/global/de/artificial-intelligence/machine-learning/reinforcement-learning/rlhf","language":"de","category":"general","pageName":"RLHF: Menschliches Feedback zur Verhaltensanpassung von KI-Modellen nutzen","contentTags":["snowflake-site:taxonomy/content-type/fundamentals"]},"isPasswordProtected":false,"analyticsContentTags":["snowflake-site:taxonomy/content-type/fundamentals"],"analyticsEnabled":true,":mappedPath":"/de/artificial-intelligence/machine-learning/reinforcement-learning/rlhf/",":type":"snowflake-site/components/structure/page",":hierarchyType":"page",":path":"/content/snowflake-site/global/de/artificial-intelligence/machine-learning/reinforcement-learning/rlhf","locale":"de"}
  