{"templateName":"fundamentals-template","cssClassNames":"fundamentals-page page basicpage summit-page","allowedRenditionsWidth":["320","480","640","768","960","1200","1440","1920"],"description":"Was ist Reinforcement Learning? Wir beleuchten verschiedene Arten, einschließlich Deep Reinforcement Learning, zeigen Praxisbeispiele und die Rolle von Agenten.","language":"de","title":"Was ist Reinforcement Learning? Ein Leitfaden zur Funktionsweise","analyticsPageType":"homepage","analyticsCategory":"general","analyticsSubCategory":"","excludeFromAnalytics":false,":mappedPath":"/de/artificial-intelligence/machine-learning/reinforcement-learning/",":type":"snowflake-site/components/structure/page",":items":{"root":{"columnCount":12,"columnClassNames":{"experiencefragment-banner":"aem-GridColumn aem-GridColumn--default--12","experiencefragment-header":"aem-GridColumn aem-GridColumn--default--12","responsivegrid":"aem-GridColumn aem-GridColumn--default--12","experiencefragment-footer":"aem-GridColumn aem-GridColumn--default--12 aem-GridColumn--offset--default--0 aem-GridColumn--default--none","experiencefragment":"aem-GridColumn aem-GridColumn--default--12 aem-GridColumn--offset--default--0 aem-GridColumn--default--none","markup_editor":"aem-GridColumn aem-GridColumn--default--12","modal_container":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12",":items":{"experiencefragment-banner":{"id":"experiencefragment-75c7658c86","localizedFragmentVariationPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/pushdown-banner/master/jcr:content","configured":true,":type":"snowflake-site/components/experiencefragment","xfModelPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/pushdown-banner/master.xfmodel.json?callerPage=/content/snowflake-site/global/de/artificial-intelligence/machine-learning/reinforcement-learning"},"experiencefragment-header":{"id":"experiencefragment-128ff0518c","localizedFragmentVariationPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/mega-nav-header/master/jcr:content","configured":true,":type":"snowflake-site/components/experiencefragment","xfModelPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/mega-nav-header/master.xfmodel.json?callerPage=/content/snowflake-site/global/de/artificial-intelligence/machine-learning/reinforcement-learning"},"markup_editor":{"id":"markup-editor-c34aeb24a8","title":" ","cssContent":"div.snowflake-breadcrumb a.snowflake-breadcrumb-item,.snowflake-breadcrumb div.snowflake-breadcrumb-item{text-transform:none;font-weight:500}.snowflake-breadcrumb svg{display:none !important}.snowflake-breadcrumb a:has(svg)::after{content:'/';margin:0 12px;color:#666}.fundamentals-hero .display-2-v2{text-transform:none !important}@media screen and (min-width:1024px){.fundamentals-hero .snowflake-hero-system-inner snowflake-container snowflake-hero-system-layout-60-40{width:80% !important;max-width:700px !important}}.snowflake-hero-system-buttons-container+div:has(.snowflake-manual-breadcrumbs),.snowflake-hero-system-buttons-container+div:has(.fundamentals-hero__breadcrumbs),.snowflake-hero-system-buttons-container+div:has(.snowflake-breadcrumb){order:-1}.fundamentals-hero__breadcrumbs ol li:not(:last-child)::after{content:'';display:inline-block;width:12px;height:12px;background-image:url(\"data:image/svg+xml,%3Csvg xmlns='http://www.w3.org/2000/svg' fill='none' viewBox='0 0 10 10' data-testid='button-link-icon' class='link-icon'%3E%3Cpath d='m1.572 9.515 4.417-4.447L1.497.548' stroke='%23666'%3E%3C/path%3E%3C/svg%3E\");background-size:contain;background-repeat:no-repeat;background-position:center;margin:0 12px}.fundamentals-hero__breadcrumbs ol{margin:0;padding:0;list-style-type:none;display:flex;flex-direction:row;align-items:center}#subNav .subnav__item.subnav__item--features{color:var(--ui-01)}#subNav .subnav__item.subnav__item--features::after{content:'';display:block;width:100%;height:4px;margin:0 12px;background:var(--ui-01);position:absolute;bottom:-18.5px;left:0}.use-case-hero__architecture{background:#fff;border-radius:8px}@media screen and (min-width:768px){.use-case-body\u003E.snowflake-flexible-column-container-items\u003Ediv:first-child{position:sticky;top:200px}}.page-toc ul{list-style-type:none;padding:0}.page-toc li{padding:8px 16px;border-left:4px solid var(--ui-01);cursor:pointer;transition:300ms ease all}.page-toc li:hover{color:var(--ui-01);border-color:#7fd3f1;transition:300ms ease all}.story-highlights{padding:48px;border-radius:4px}.logo-container{max-width:180px}.flex-container\u003E.container\u003E.cmp-container\u003E.aem-container{align-items:center;justify-content:center;gap:48px;flex-wrap:nowrap}.flex-container\u003E.container\u003E.cmp-container\u003E.aem-container\u003Ediv{width:auto;margin:0 !important}.flex-container\u003E.container\u003E.cmp-container\u003E.aem-container\u003Ediv:last-child{flex-grow:1}.flex-container .aem-Grid::before,.flex-container .aem-Grid::after{display:none !important}.use-case-body table{margin-top:24px;margin-bottom:24px;width:100%;background-color:var(--ui-background-01);border-collapse:collapse;border:2px solid var(--ui-background-09);font-family:'Lato',sans-serif;color:var(--ui-background-09)}.use-case-body table thead{background-color:var(--ui-01)}.use-case-body th,.use-case-body td{min-width:120px;border:2px solid var(--ui-background-09);padding:var(--spacing-01)}.use-case-body ol{margin-top:0 !important}.use-case-body ol li{margin-bottom:1rem !important}#subNav .subnav__item.subnav__item--features{color:var(--ui-01)}#subNav .subnav__item.subnav__item--features::after{content:'';display:block;width:100%;height:4px;background:var(--ui-01);position:absolute;bottom:-18.5px;left:0}.use-case-hero__architecture{background:#fff;border-radius:8px}@media screen and (min-width:768px){.use-case-body\u003E.snowflake-flexible-column-container-items\u003Ediv:first-child{position:sticky;top:200px}}.page-toc ul{list-style-type:none;padding:0}.page-toc li{padding:8px 16px;border-left:4px solid var(--ui-01);cursor:pointer;transition:300ms ease all}.page-toc li:hover{color:var(--ui-01);border-color:#7fd3f1;transition:300ms ease all}.story-highlights{padding:48px;border-radius:4px}.logo-container{max-width:180px}.flex-container\u003E.container\u003E.cmp-container\u003E.aem-container{align-items:center;justify-content:center;gap:48px;flex-wrap:nowrap}.flex-container\u003E.container\u003E.cmp-container\u003E.aem-container\u003Ediv{width:auto;margin:0 !important}.flex-container\u003E.container\u003E.cmp-container\u003E.aem-container\u003Ediv:last-child{flex-grow:1}.flex-container .aem-Grid::before,.flex-container .aem-Grid::after{display:none !important}.snowflake-highlights{overflow:hidden;background-color:var(--ui-background-05);padding-left:24px;padding-right:24px;border:1px solid #ccc;border-radius:8px}div.use-case-body .snowflake-text h2,div.use-case-body .snowflake-text .heading-2-v2,div.use-case-body .snowflake-text h3,div.use-case-body .snowflake-text .heading-3-v2,div.use-case-body .snowflake-title-v2 .heading-3-v2,div.use-case-body .snowflake-text h4,div.use-case-body .snowflake-text .heading-4-v2,div.use-case-body .snowflake-title-v2 .heading-4-v2,div.use-case-body .snowflake-text h5,div.use-case-body .snowflake-text .heading-5-v2,div.use-case-body .snowflake-title-v2 .heading-5-v2,div.use-case-body .snowflake-text h6,div.use-case-body .snowflake-title-v2 .heading-6-v2,div.use-case-body .snowflake-text .heading-6-v2{text-transform:none !important}div.use-case-body .snowflake-text h2,div.use-case-body .snowflake-text .heading-2-v2,div.use-case-body .snowflake-text h3,div.use-case-body .snowflake-text .heading-3-v2,div.use-case-body .snowflake-text h4,div.use-case-body .snowflake-text .heading-4-v2,div.use-case-body .snowflake-text h5,div.use-case-body .snowflake-text .heading-5-v2,div.use-case-body .snowflake-text h6,div.use-case-body .snowflake-text .heading-6-v2{margin-top:1.5rem !important;line-height:1.1 !important}div.use-case-body .snowflake-text h3,div.use-case-body .snowflake-text .heading-3-v2,div.use-case-body .snowflake-text .heading-3-v2,div.use-case-body .snowflake-title-v2 .heading-3-v2,div.use-case-body .snowflake-text h4,div.use-case-body .snowflake-text .heading-4-v2,div.use-case-body .snowflake-text .heading-4-v2,div.use-case-body .snowflake-title-v2 .heading-4-v2,div.use-case-body .snowflake-text h5,div.use-case-body .snowflake-text .heading-5-v2,div.use-case-body .snowflake-text .heading-5-v2,div.use-case-body .snowflake-title-v2 .heading-5-v2,div.use-case-body .snowflake-text h6,div.use-case-body .snowflake-text .heading-6-v2,div.use-case-body .snowflake-text .heading-6-v2,div.use-case-body .snowflake-title-v2 .heading-6-v2{font-family:Lato,sans-serif !important;font-weight:800 !important}div.use-case-body .snowflake-text h2,div.use-case-body .snowflake-text .heading-2-v2,div.use-case-body .snowflake-title-v2 .heading-2-v2{text-transform:none !important;font-size:28px !important}div.use-case-body .snowflake-text h3,div.use-case-body .snowflake-text .heading-3-v2,div.use-case-body .snowflake-title-v2 .heading-3-v2{font-size:22px !important}div.use-case-body .snowflake-text h4,div.use-case-body .snowflake-text .heading-4-v2,div.use-case-body .snowflake-title-v2 .heading-4-v2{font-size:18px !important}div.use-case-body .snowflake-text h5,div.use-case-body .snowflake-text .heading-5-v2,div.use-case-body .snowflake-title-v2 .heading-5-v2{font-size:16px !important}div.use-case-body .snowflake-text h6,div.use-case-body .snowflake-text .heading-6-v2,div.use-case-body .snowflake-title-v2 .heading-6-v2{font-size:14px !important}@media screen and (min-width:992px){div.use-case-body .snowflake-text h2,div.use-case-body .snowflake-text .heading-2-v2,div.use-case-body .snowflake-title-v2 .heading-2-v2{font-size:38px !important}div.use-case-body .snowflake-text h3,div.use-case-body .snowflake-text .heading-3-v2,div.use-case-body .snowflake-title-v2 .heading-3-v2{font-size:26px !important}div.use-case-body .snowflake-text h4,div.use-case-body .snowflake-text .heading-4-v2,div.use-case-body .snowflake-title-v2 .heading-4-v2{font-size:22px !important}div.use-case-body .snowflake-text h5,div.use-case-body .snowflake-text .heading-5-v2,div.use-case-body .snowflake-title-v2 .heading-5-v2{font-size:18px !important}div.use-case-body .snowflake-text h6,div.use-case-body .snowflake-text .heading-6-v2,div.use-case-body .snowflake-title-v2 .heading-6-v2{font-size:16px !important}}","jsContent":"window.addEventListener('click',(e)=\u003E{if(e.target.tagName==='LI'&&e.target.dataset.anchor){const target=document.getElementById(e.target.dataset.anchor);if(target){const targetPosition=target.getBoundingClientRect().top+window.pageYOffset-220;window.scrollTo({top:targetPosition,behavior:'smooth'});}}});",":type":"snowflake-site/components/markup-editor","isGSAPEnabled":false},"responsivegrid":{"columnCount":12,"columnClassNames":{"container":"aem-GridColumn aem-GridColumn--default--12","container_411970921_":"aem-GridColumn aem-GridColumn--default--12","hero_system_copy":"aem-GridColumn aem-GridColumn--default--12","container_copy":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12",":items":{"hero_system_copy":{"id":"hero-system-3aadf22fe6","additionalClasses":"fundamentals-hero","heroStyle":"primary","headline":{"id":"headline","type":"display2","lines":["Was ist Reinforcement Learning? Ein umfassender Leitfaden"],":type":"snowflake-site/components/title-v2"},"subheadline":{"id":"subheadline","text":"\u003Cp\u003EDie meisten Systeme für maschinelles Lernen&nbsp;(ML, Machine Learning) lernen, indem sie statische Daten untersuchen. Sie erfassen gekennzeichnete Datasets, erkennen Muster und treffen Prognosen auf Grundlage dessen, was sie aus diesen Datasets und Mustern gelernt haben. Verstärkungslernen (Reinforcement Learning,&nbsp;RL), das auch als „bestärkendes Lernen“ bezeichnet wird, verfolgt einen anderen Ansatz. Hierbei lernt ein System, indem es mit einer Umgebung interagiert: Es führt Aktionen aus, beobachtet die Ergebnisse und passt sein Verhalten auf Grundlage von Belohnungen oder Strafen an. Mit der Zeit kann es so Strategien entdecken, die den langfristigen Erfolg maximieren.\u003C/p\u003E\r\n","richText":true,":type":"snowflake-site/components/text"},"layout":"60-40","buttons_container":{"layout":"SIMPLE","id":"container-c8d0aeb290",":type":"snowflake-site/components/button/buttons-container",":items":{},":itemsOrder":[]},"flexible_container":{"layout":"SIMPLE","id":"container-96ae2baebe",":type":"snowflake-site/components/container",":items":{"breadcrumb":{"id":"breadcrumb-46a2ed1729","items":[{"id":"breadcrumb-46a2ed1729-item-b4dc78da23","link":{"valid":true,"url":"/de/artificial-intelligence/"},"active":false,"current":false,"title":"Künstliche Intelligenz",":type":"snowflake-site/components/structure/page","appliedCssClassNames":"summit-page"},{"id":"breadcrumb-46a2ed1729-item-1b882f3034","link":{"valid":true,"url":"/de/artificial-intelligence/machine-learning/"},"active":false,"current":false,"title":"Machine Learning",":type":"snowflake-site/components/structure/page","appliedCssClassNames":"summit-page"},{"id":"breadcrumb-46a2ed1729-item-8ac6a2f41a","link":{"valid":true,"url":"/de/artificial-intelligence/machine-learning/reinforcement-learning/"},"active":true,"current":true,"title":"Reinforcement Learning",":type":"snowflake-site/components/structure/fundamentals-page","appliedCssClassNames":"summit-page"}],":type":"snowflake-site/components/breadcrumb"}},":itemsOrder":["breadcrumb"]},":type":"snowflake-site/components/hero-system","appliedCssClassNames":"snowflake-hero-system-background-grad-white"},"container_copy":{"layout":"RESPONSIVE_GRID","columnCount":12,"columnClassNames":{"container":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","id":"container-60174ca0e9",":type":"snowflake-site/components/container",":items":{"container":{"layout":"RESPONSIVE_GRID","columnCount":12,"columnClassNames":{"flexible_column_cont":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","id":"container-7e393fc9f1",":type":"snowflake-site/components/container",":items":{"flexible_column_cont":{"id":"flexible-column-container-617ec81181","type":"2-column-25-75","alignColumns":"top","containerMaxWidth":"extra-large","topPadding":"medium","bottomPadding":"medium","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"propertiesCSSClasses":"use-case-body","backgroundImageOption":"none","flexible_column_content_container_1":{"layout":"SIMPLE","id":"container-c54c9814f9",":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container",":items":{"text":{"id":"text-c849a827de","additionalClasses":"page-toc","text":"\u003Cul\u003E\u003Cli data-anchor=\"what-is-reinforcement-learning\"\u003EWas ist Reinforcement Learning?\u003C/li\u003E\u003Cli data-anchor=\"how-does-reinforcement-learning-work\"\u003EWie funktioniert Reinforcement Learning?\u003C/li\u003E\u003Cli data-anchor=\"types-of-reinforcement-learning\"\u003EArten von Reinforcement Learning\u003C/li\u003E\u003Cli data-anchor=\"reinforcement-learning-techniques\"\u003ETechniken für Reinforcement Learning\u003C/li\u003E\u003Cli data-anchor=\"reinforcement-learning-examples-and-applications\"\u003EBeispiele und Anwendungen für Reinforcement Learning\u003C/li\u003E\u003Cli data-anchor=\"advantages-of-reinforcement-learning\"\u003EVorteile von Reinforcement Learning\u003C/li\u003E\u003Cli data-anchor=\"disadvantages-of-reinforcement-learning\"\u003ENachteile von Reinforcement Learning\u003C/li\u003E\u003Cli data-anchor=\"reinforcement-learning-in-the-ai-data-cloud\"\u003EReinforcement Learning in der AI Data Cloud\u003C/li\u003E\u003Cli data-anchor=\"reinforcement-learning-faqs\"\u003EHäufig gestellte Fragen zum Reinforcement Learning\u003C/li\u003E\u003Cli data-anchor=\"resources\"\u003ERessourcen\u003C/li\u003E\u003C/ul\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-size-regular text-color-text-05"},"experiencefragment":{"id":"experiencefragment-c4d411ffc0","localizedFragmentVariationPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/share-icons/share-icons-no-title/jcr:content","configured":true,":type":"snowflake-site/components/experiencefragment","xfModelPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/share-icons/share-icons-no-title.xfmodel.json?callerPage=/content/snowflake-site/global/de/artificial-intelligence/machine-learning/reinforcement-learning"}},":itemsOrder":["text","experiencefragment"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-small"},"flexible_column_content_container_2":{"layout":"SIMPLE","id":"fundamentals-main-content",":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container",":items":{"section_0":{"layout":"RESPONSIVE_GRID","columnCount":12,"columnClassNames":{"text_0":"aem-GridColumn aem-GridColumn--default--12","title_v2":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","id":"what-is-reinforcement-learning",":type":"snowflake-site/components/container",":items":{"title_v2":{"id":"title-v2-024eee4b58","type":"heading2","lines":["Was ist Reinforcement Learning?"],":type":"snowflake-site/components/title-v2"},"text_0":{"id":"text-7410ccec3b","additionalClasses":"list--blue-bullets","text":"\u003Cp\u003EDie meisten Systeme für maschinelles Lernen (ML) lernen, indem sie statische Daten untersuchen. Sie erfassen gekennzeichnete Datasets, erkennen Muster und treffen Prognosen auf Grundlage dessen, was sie aus diesen Datasets und Mustern gelernt haben. Verstärkungslernen (Reinforcement Learning, RL), das auch als „bestärkendes Lernen“ bezeichnet wird, verfolgt einen anderen Ansatz. Hierbei lernt ein System, indem es mit einer Umgebung interagiert: Es führt Aktionen aus, beobachtet die Ergebnisse und passt sein Verhalten auf Grundlage von Belohnungen oder Strafen an. Mit der Zeit kann es so Strategien entdecken, die den langfristigen Erfolg maximieren.\u003C/p\u003E\n\u003Cp\u003EReinforcement Learning ist ein Zweig des \u003Ca href=\"https://www.snowflake.com/de/artificial-intelligence/machine-learning/\"\u003Emaschinellen Lernens\u003C/a\u003E, in dem ein intelligentes System – das oft als „Agent“ bezeichnet wird – lernt, Entscheidungen zu treffen, indem es mit einer Umgebung interagiert.\u003C/p\u003E\n\u003Cp\u003EJeder Schritt läuft wie folgt ab:\u003C/p\u003E\n\u003Cul\u003E\n\u003Cli\u003EDer Agent beobachtet die aktuelle Situation (den Zustand).\u003C/li\u003E\n\u003Cli\u003EEr wählt eine Aktion.\u003C/li\u003E\n\u003Cli\u003EDie Umgebung reagiert.\u003C/li\u003E\n\u003Cli\u003EDer Agent erhält eine Belohnung oder Strafe (die auch als „negative Belohnung“ bezeichnet wird).\u003C/li\u003E\n\u003Cli\u003EDer Prozess wiederholt sich.\u003C/li\u003E\n\u003C/ul\u003E\n\u003Cp\u003EDas Ziel besteht nicht einfach darin, die größte sofortige Belohnung zu verdienen. Stattdessen versucht der Agent, die kumulative Belohnung mit der Zeit zu maximieren. Dieser Fokus auf langfristige Ergebnisse unterscheidet Reinforcement Learning von vielen anderen ML-Ansätzen.\u003C/p\u003E\n","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"}},":itemsOrder":["title_v2","text_0"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-extra-small"},"section_1":{"layout":"RESPONSIVE_GRID","columnCount":12,"columnClassNames":{"youtube":"aem-GridColumn aem-GridColumn--default--12","h3_title_3":"aem-GridColumn aem-GridColumn--default--12","h3_title_4":"aem-GridColumn aem-GridColumn--default--12","text_1":"aem-GridColumn aem-GridColumn--default--12","h3_title_5":"aem-GridColumn aem-GridColumn--default--12","text_0":"aem-GridColumn aem-GridColumn--default--12","title_v2":"aem-GridColumn aem-GridColumn--default--12","h3_title_0":"aem-GridColumn aem-GridColumn--default--12","h3_title_1":"aem-GridColumn aem-GridColumn--default--12","h3_title_2":"aem-GridColumn aem-GridColumn--default--12","text_3":"aem-GridColumn aem-GridColumn--default--12","text_2":"aem-GridColumn aem-GridColumn--default--12","text_5":"aem-GridColumn aem-GridColumn--default--12","text_4":"aem-GridColumn aem-GridColumn--default--12","text_6":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","id":"how-does-reinforcement-learning-work",":type":"snowflake-site/components/container",":items":{"title_v2":{"id":"title-v2-a061385898","type":"heading2","lines":["Wie funktioniert Reinforcement Learning?"],":type":"snowflake-site/components/title-v2"},"youtube":{"id":"embed-62867586a3","youtubeVideoId":"Eh33vfAP30U","layout":"responsive","youtubeAspectRatio":"56.25","youtubeAutoPlay":false,"youtubeLoop":false,"youtubeMute":false,"youtubePlaysInline":false,"youtubeRel":false,"embeddableResourceType":"core/wcm/components/embed/v1/embed/embeddable/youtube","type":"EMBEDDABLE",":type":"snowflake-site/components/youtube"},"text_0":{"id":"text-f41f0ba8cb","text":"\u003Cp\u003EIm Kern wird Reinforcement Learning durch eine Feedbackschleife definiert, die auf mehreren Schlüsselkomponenten basiert:\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_0":{"id":"title-v2-b8842a20ac","type":"heading3","lines":["Der Agent"],":type":"snowflake-site/components/title-v2"},"text_1":{"id":"text-fe785c5be7","text":"\u003Cp\u003EDer RL-Agent ist der Entscheidungsträger. Hierbei kann es sich um einen Roboter handeln, der seine Greifkraft anpasst, eine Preis-Engine, die Rabatte auswählt, oder ein neuronales Netz, das Strategien zur Textgenerierung optimiert. Ziel des Agenten ist es, eine Strategie (oder „Policy“) zu lernen – also eine Regel für die Auswahl von Aktionen in verschiedenen Situationen –, die die kumulative Belohnung maximiert.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_1":{"id":"title-v2-f1795e2f97","type":"heading3","lines":["Die Umgebung"],":type":"snowflake-site/components/title-v2"},"text_2":{"id":"text-6075031a9b","text":"\u003Cp\u003EDie Umgebung umfasst alles, womit der Agent interagiert. Bei einer Aufgabe in der Robotik kann die Umgebung beispielsweise die physische Welt sein. In einem Empfehlungssystem kann sie Nutzerreaktionen und Verhaltenssignale umfassen. In einer Trainingssimulation kann sie vollständig virtuell sein. Die Umgebung reagiert auf jede Aktion, indem sie zu einem neuen Zustand wechselt und eine Belohnung ausgibt.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_2":{"id":"title-v2-98c4bf8a63","type":"heading3","lines":["Der Zustand"],":type":"snowflake-site/components/title-v2"},"text_3":{"id":"text-cc4fa966ac","text":"\u003Cp\u003EDer Zustand stellt die Informationen dar, die dem Agenten zum jeweiligen Zeitpunkt zur Verfügung stehen. Er erfasst relevante Aspekte der Umgebung, die die Entscheidungsfindung beeinflussen. In einem System zur Lageroptimierung kann der Zustand Bestandsmengen, Nachfrageprognosen und Versandbeschränkungen umfassen. In einem dialogorientierten KI-System kann der Zustand den Dialogkontext darstellen. Zustände entwickeln sich mit der Zeit weiter, während der Agent handelt.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_3":{"id":"title-v2-73e2b9a99c","type":"heading3","lines":["Die Aktion"],":type":"snowflake-site/components/title-v2"},"text_4":{"id":"text-d997ae8e17","text":"\u003Cp\u003EEine Aktion ist jede Entscheidung, die der Agent treffen kann. In einigen Systemen sind Aktionen diskret, wie z. B. eine Bewegung nach links oder rechts. In anderen sind sie kontinuierlich, z. B. die Anpassung des Winkels eines Roboterarms um einen genauen Wert. In \u003Ca href=\"https://www.snowflake.com/de/fundamentals/generative-ai-architecture-models-applications/\"\u003EGenAI\u003C/a\u003E-Systemen (generative KI) kann eine Aktion die Auswahl des nächsten Tokens in einer Sequenz umfassen. Jede Aktion beeinflusst, was als Nächstes passiert.\u003C/p\u003E\n","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_4":{"id":"title-v2-ddded51092","type":"heading3","lines":["Die Belohnung"],":type":"snowflake-site/components/title-v2"},"text_5":{"id":"text-f81a243695","text":"\u003Cp\u003EDie Belohnung ist das Signal, das das Lernen fördert – sie codiert das Ziel des Systems. Die richtigen Belohnungen zu entwickeln, ist ein komplexer Prozess, da selbst kleine Abstimmungsfehler dazu führen können, dass der Agent seine Strategie auf unbeabsichtigte Abkürzungen optimiert und nicht auf das eigentliche Ziel. Wenn sich eine Empfehlungs-Engine beispielsweise nur auf Klicks optimiert, lernt sie vielleicht, aufsehenerregende Inhalte zu bevorzugen, was auf Kosten der langfristigen Zufriedenheit gehen kann. Die Herausforderung besteht darin, das Belohnungsdesign auf reale Ziele abzustimmen.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_5":{"id":"title-v2-f7966660a5","type":"heading3","lines":["Der Lernprozess"],":type":"snowflake-site/components/title-v2"},"text_6":{"id":"text-47af5a1eb4","text":"\u003Cp\u003EReinforcement Learning erfolgt in einem wiederholten Zyklus: beobachten, handeln, Feedback erhalten, Strategie anpassen und wiederholen. Mit der Zeit schätzt der Agent, welche Aktionen langfristig wahrscheinlich bessere Ergebnisse generieren werden. In der Anfangsphase des Trainings untersucht der Agent breite Aktionen, die möglicherweise nicht optimal sind. Ziel ist es hierbei, Informationen zu sammeln. Allmählich geht er dann zur Ausnutzung (des erlernten Wissens) über: Der Agent wählt Aktionen aus, von denen er glaubt, dass sie die besten Ergebnisse erzielen werden. Exploration und Ausnutzung in Einklang zu bringen, ist eine der wichtigsten Herausforderungen beim Reinforcement Learning.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"}},":itemsOrder":["title_v2","youtube","text_0","h3_title_0","text_1","h3_title_1","text_2","h3_title_2","text_3","h3_title_3","text_4","h3_title_4","text_5","h3_title_5","text_6"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-extra-small"},"section_2":{"layout":"RESPONSIVE_GRID","columnCount":12,"columnClassNames":{"text_1":"aem-GridColumn aem-GridColumn--default--12","text_0":"aem-GridColumn aem-GridColumn--default--12","title_v2":"aem-GridColumn aem-GridColumn--default--12","h3_title_0":"aem-GridColumn aem-GridColumn--default--12","text_2":"aem-GridColumn aem-GridColumn--default--12","h3_title_1":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","id":"types-of-reinforcement-learning",":type":"snowflake-site/components/container",":items":{"title_v2":{"id":"title-v2-42d6d4814f","type":"heading2","lines":["Arten von Reinforcement Learning"],":type":"snowflake-site/components/title-v2"},"text_0":{"id":"text-cd1bfb30b1","text":"\u003Cp\u003ERL-Systeme lassen sich im Allgemeinen in zwei breite Kategorien einteilen: modellbasierte und modellfreie Ansätze.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_0":{"id":"title-v2-2aca7d9c0b","type":"heading3","lines":["Modellbasiertes Reinforcement Learning"],":type":"snowflake-site/components/title-v2"},"text_1":{"id":"text-757f630baf","text":"\u003Cp\u003EModellbasierte Methoden versuchen zu lernen oder abzubilden, wie die Umgebung funktioniert. Der Agent erstellt ein Modell, das vorhersagt, wie sich Zustände als Reaktion auf Aktionen verändern und welche Belohnungen folgen werden. Mit einem solchen Modell kann der Agent mögliche künftige Zustände simulieren, bevor er handelt. Das ermöglicht es dem Agenten, zu planen, und kann die Dateneffizienz verbessern. Die Entwicklung genauer Umgebungsmodelle wird jedoch mit zunehmender Komplexität der Systeme immer schwieriger.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_1":{"id":"title-v2-2376606fba","type":"heading3","lines":["Modellfreies Reinforcement Learning"],":type":"snowflake-site/components/title-v2"},"text_2":{"id":"text-1a18978c01","text":"\u003Cp\u003EModellfreie Methoden überspringen die explizite Modellierung der Umgebung. Stattdessen lernt der Agent anhand seiner Erfahrung, welche Aktionen tendenziell höhere Belohnungen generieren. Dieser Ansatz lässt sich einfacher einrichten und oft besser auf hochdimensionale Probleme erweitern. Die meisten modernen Deep-Reinforcement-Learning-Systeme – insbesondere solche mit neuronalen Netzen – basieren auf modellfreien Techniken. Der Nachteil besteht darin, dass modellfreie Systeme möglicherweise erhebliche Mengen an Interaktionsdaten für die Konvergenz benötigen.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"}},":itemsOrder":["title_v2","text_0","h3_title_0","text_1","h3_title_1","text_2"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-extra-small"},"section_3":{"layout":"RESPONSIVE_GRID","columnCount":12,"columnClassNames":{"h3_title_3":"aem-GridColumn aem-GridColumn--default--12","text_1":"aem-GridColumn aem-GridColumn--default--12","text_0":"aem-GridColumn aem-GridColumn--default--12","text_3":"aem-GridColumn aem-GridColumn--default--12","title_v2":"aem-GridColumn aem-GridColumn--default--12","h3_title_0":"aem-GridColumn aem-GridColumn--default--12","text_2":"aem-GridColumn aem-GridColumn--default--12","h3_title_1":"aem-GridColumn aem-GridColumn--default--12","h3_title_2":"aem-GridColumn aem-GridColumn--default--12","text_4":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","id":"reinforcement-learning-techniques",":type":"snowflake-site/components/container",":items":{"title_v2":{"id":"title-v2-42e9f2819e","type":"heading2","lines":["Techniken für Reinforcement Learning"],":type":"snowflake-site/components/title-v2"},"text_0":{"id":"text-892fa25a41","text":"\u003Cp\u003EModerne RL-Systeme bauen in der Regel auf einer kleinen Anzahl zentraler Algorithmenfamilien auf. Diese Techniken werden ständig weiterentwickelt und bleiben für Robotik, Simulation, industrielle Optimierung und groß angelegte KI-Abstimmung von zentraler Bedeutung.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_0":{"id":"title-v2-139f7974de","type":"heading3","lines":["Q-Lernen"],":type":"snowflake-site/components/title-v2"},"text_1":{"id":"text-02cd58f669","text":"\u003Cp\u003EQ-Lernen ist einer der grundlegenden Ansätze im Reinforcement Learning. Im Kern schätzt es die erwartete kumulative Belohnung für eine bestimmte Aktion in einem bestimmten Zustand und aktualisiert diese Schätzungen auf Grundlage der beobachteten Ergebnisse. In kleinen oder strukturierten Umgebungen lässt sich Q-Lernen mithilfe tabellarischer Darstellungen umsetzen. In der Praxis bilden die zugrunde liegenden Prinzipien – insbesondere Werteschätzung und eigenständiges Lernen (oder „Bootstrapped Learning“) – die Grundlage für fortschrittlichere wertbasierte Methoden. Q-Lernen ist eher ein grundlegendes Konzept des modernen Reinforcement Learning als eine eigenständige Lösung.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_1":{"id":"title-v2-bf5ed86680","type":"heading3","lines":["Deep Q-Networks (DQN)"],":type":"snowflake-site/components/title-v2"},"text_2":{"id":"text-c4d8ab1a0a","text":"\u003Cp\u003EDeep Q-Networks erweitern das Q-Lernen, indem Lookup-Tabellen durch neuronale Netze ersetzt werden, die die Aktion-Wert-Funktion approximieren. Mit diesem Ansatz ist es möglich, das Reinforcement Learning auf hochdimensionale Eingaben wie Bilder, Sensordaten und komplexe Zustandsdarstellungen zu erweitern. DQNs und ihre modernen Varianten – darunter Double DQN und verteilte Ansätze – kommen in Umgebungen mit diskreten Aktionen sowie in simulationsbasierten Trainingssystemen zum Einsatz. DQNs haben auch beigetragen, die Machbarkeit von Deep Reinforcement Learning zu gewährleisten, bei dem neuronale Netze und belohnungsbasiertes Lernen in großem Umfang zusammenarbeiten.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_2":{"id":"title-v2-9d6cbf178f","type":"heading3","lines":["Policy-Gradient-Methoden"],":type":"snowflake-site/components/title-v2"},"text_3":{"id":"text-e7e68560ff","text":"\u003Cp\u003EPolicy-Gradient-Methoden optimieren die Strategie direkt, anstatt Aktionswerte zu schätzen. Anstatt zu fragen: „Wie gut ist diese Aktion?“, fragen diese Methoden: „Wie sollte sich die Entscheidungsstrategie ändern, um die erwartete Belohnung zu verbessern?“ Diese Methoden sind insbesondere bei kontinuierlichen Steuerungsproblemen wie in der Robotik wichtig, bei denen Aktionen nicht auf diskrete Entscheidungen beschränkt sind. Sie spielen auch eine zentrale Rolle in modernen, groß angelegten KI-Trainingsworkflows, einschließlich Modellabstimmung und -optimierung.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_3":{"id":"title-v2-fd75c7ae2a","type":"heading3","lines":["Actor-Critic-Methoden"],":type":"snowflake-site/components/title-v2"},"text_4":{"id":"text-942ca3f70b","text":"\u003Cp\u003EActor-Critic-Methoden (oder „Akteur-Kritiker-Methoden“) kombinieren wert- und strategiebasiertes Lernen. Der Akteur aktualisiert die Entscheidungsstrategie, während der Kritiker bewertet, wie effektiv spezifische Aktionen in einem bestimmten Zustand sind. Diese hybride Struktur verbessert die Stabilität und Stichprobeneffizienz, was in großen und komplexen Umgebungen entscheidend ist. Viele der modernsten Algorithmen, die heute zum Einsatz kommen – wie Proximal Policy Optimization (PPO) und Soft Actor-Critic (SAC) –, sind Actor-Critic-Varianten, die in modernen RL-Anwendungen vorherrschen.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"}},":itemsOrder":["title_v2","text_0","h3_title_0","text_1","h3_title_1","text_2","h3_title_2","text_3","h3_title_3","text_4"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-extra-small"},"section_4":{"layout":"RESPONSIVE_GRID","columnCount":12,"columnClassNames":{"h3_title_3":"aem-GridColumn aem-GridColumn--default--12","text_1":"aem-GridColumn aem-GridColumn--default--12","text_0":"aem-GridColumn aem-GridColumn--default--12","text_3":"aem-GridColumn aem-GridColumn--default--12","title_v2":"aem-GridColumn aem-GridColumn--default--12","h3_title_0":"aem-GridColumn aem-GridColumn--default--12","text_2":"aem-GridColumn aem-GridColumn--default--12","h3_title_1":"aem-GridColumn aem-GridColumn--default--12","h3_title_2":"aem-GridColumn aem-GridColumn--default--12","text_4":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","id":"reinforcement-learning-examples-and-applications",":type":"snowflake-site/components/container",":items":{"title_v2":{"id":"title-v2-fd278f2840","type":"heading2","lines":["Beispiele und Anwendungen für Reinforcement Learning"],":type":"snowflake-site/components/title-v2"},"text_0":{"id":"text-84f1d7b66f","text":"\u003Cp\u003ERL-Anwendungen sind besonders effektiv in Umgebungen, in denen Aktionen Einfluss auf künftige Zustände haben.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_0":{"id":"title-v2-d44756a5c3","type":"heading3","lines":["Robotik"],":type":"snowflake-site/components/title-v2"},"text_1":{"id":"text-3c9a64c8d8","text":"\u003Cp\u003EIn der Robotik sorgt Reinforcement Learning dafür, dass Maschinen Gehen, Greifen und koordinierten Bewegungen erlernen können. Da physikalische Experimente kostspielig sind, trainieren viele Systeme im Rahmen von Simulationen, bevor sie ihr Wissen auf die reale Welt übertragen. Sequentielle Entscheidungsfindung ist in der Robotik entscheidend, weshalb sich Reinforcement Learning gut für diesen Bereich eignet.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_1":{"id":"title-v2-d5a1520744","type":"heading3","lines":["Dynamische Preisgestaltung"],":type":"snowflake-site/components/title-v2"},"text_2":{"id":"text-e1994ea2f0","text":"\u003Cp\u003ERL-Modelle können Preise kontinuierlich an Nachfragemuster, Wettbewerbssignale und Bestandsbeschränkungen anpassen. Anstatt sich auf statische Regeln zu verlassen, erlernen sie Preisstrategien, die den langfristigen Umsatz oder die Rentabilität optimieren.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_2":{"id":"title-v2-5d674ba7e1","type":"heading3","lines":["Empfehlungssysteme"],":type":"snowflake-site/components/title-v2"},"text_3":{"id":"text-5d93b1ad44","text":"\u003Cp\u003EEmpfehlungs-Engines nutzen zunehmend Reinforcement Learning, um Empfehlungen auf nachhaltige Interaktionen statt auf kurzfristige Klicks zu optimieren. Indem sie Nutzerinteraktionen als sequentiellen Prozess modellieren, können diese Systeme die Exploration neuer Inhalte mit Personalisierung in Einklang bringen.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_3":{"id":"title-v2-6165aeb707","type":"heading3","lines":["Optimierung von Large Language Models"],":type":"snowflake-site/components/title-v2"},"text_4":{"id":"text-8ff8eb2a6f","text":"\u003Cp\u003EEine der wichtigsten RL-Anwendungen ist heute die Optimierung von Large Language Models über RLHF (Reinforcement Learning from Human Feedback). Menschliche Bewertende stufen die Ausgaben des Modells ein, es wird ein Belohnungsmodell trainiert und das Reinforcement Learning passt die Strategie an, um die Ausgaben auf menschliche Präferenzen abzustimmen. Dieser Prozess spielt eine zentrale Rolle bei der Verbesserung dialogorientierter \u003Ca href=\"https://www.snowflake.com/de/artificial-intelligence/\"\u003EKI-Systeme\u003C/a\u003E.\u003C/p\u003E\n","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"}},":itemsOrder":["title_v2","text_0","h3_title_0","text_1","h3_title_1","text_2","h3_title_2","text_3","h3_title_3","text_4"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-extra-small"},"section_5":{"layout":"RESPONSIVE_GRID","columnCount":12,"columnClassNames":{"h3_title_3":"aem-GridColumn aem-GridColumn--default--12","text_1":"aem-GridColumn aem-GridColumn--default--12","text_0":"aem-GridColumn aem-GridColumn--default--12","text_3":"aem-GridColumn aem-GridColumn--default--12","title_v2":"aem-GridColumn aem-GridColumn--default--12","h3_title_0":"aem-GridColumn aem-GridColumn--default--12","text_2":"aem-GridColumn aem-GridColumn--default--12","h3_title_1":"aem-GridColumn aem-GridColumn--default--12","h3_title_2":"aem-GridColumn aem-GridColumn--default--12","text_4":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","id":"advantages-of-reinforcement-learning",":type":"snowflake-site/components/container",":items":{"title_v2":{"id":"title-v2-50ad9dd657","type":"heading2","lines":["Vorteile von Reinforcement Learning"],":type":"snowflake-site/components/title-v2"},"text_0":{"id":"text-8f118e3160","text":"\u003Cp\u003EReinforcement Learning hebt sich von anderen ML-Ansätzen ab, da es speziell für die Entscheidungsfindung im Laufe der Zeit entwickelt wurde. Anstatt eine einzige Prognose zu verbessern, optimiert es das Verhalten über Aktionssequenzen hinweg – das macht sie besonders leistungsstark in dynamischen, unsicheren Umgebungen, in denen sich die Ergebnisse nach und nach entfalten.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_0":{"id":"title-v2-4a45582dda","type":"heading3","lines":["Löst komplexe sequentielle Probleme"],":type":"snowflake-site/components/title-v2"},"text_1":{"id":"text-28cf1285f4","text":"\u003Cp\u003EIm Gegensatz zu statischen \u003Ca href=\"https://www.snowflake.com/en/fundamentals/predictive-modeling/\"\u003EPrognosemodellen\u003C/a\u003E kann Reinforcement Learning Sequenzen von Aktionen im Laufe der Zeit optimieren. Das macht es besonders wertvoll in Logistik, Robotik und adaptiven KI-Systemen.\u003C/p\u003E\n","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_1":{"id":"title-v2-39bb19cc02","type":"heading3","lines":["Erfordert keine gekennzeichneten Datasets"],":type":"snowflake-site/components/title-v2"},"text_2":{"id":"text-d11a88fec1","text":"\u003Cp\u003EReinforcement Learning erfordert keine gekennzeichneten Eingabe-Ausgabe-Paare. Stattdessen lernt es durch Belohnungssignale und eignet sich so, wenn nur wenige gekennzeichnete Daten verfügbar sind.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_2":{"id":"title-v2-04ec6a93d0","type":"heading3","lines":["Konzentriert sich auf den langfristigen Wert"],":type":"snowflake-site/components/title-v2"},"text_3":{"id":"text-502421b3fb","text":"\u003Cp\u003EIndem Reinforcement Learning die kumulative Belohnung optimiert, berücksichtigt es explizit verzögerte Konsequenzen – eine wichtige Funktion in vielen Systemen.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_3":{"id":"title-v2-b4a5a77cee","type":"heading3","lines":["Passt sich durch Interaktion an"],":type":"snowflake-site/components/title-v2"},"text_4":{"id":"text-14f48ebafb","text":"\u003Cp\u003EDa Agenten aus Interaktionen lernen, können sie sich anpassen, wenn sich Umgebungen verändern, insbesondere in simulierten Systemen oder in Systemen, die kontinuierlich angepasst werden.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"}},":itemsOrder":["title_v2","text_0","h3_title_0","text_1","h3_title_1","text_2","h3_title_2","text_3","h3_title_3","text_4"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-extra-small"},"section_6":{"layout":"RESPONSIVE_GRID","columnCount":12,"columnClassNames":{"h3_title_3":"aem-GridColumn aem-GridColumn--default--12","text_1":"aem-GridColumn aem-GridColumn--default--12","text_0":"aem-GridColumn aem-GridColumn--default--12","text_3":"aem-GridColumn aem-GridColumn--default--12","title_v2":"aem-GridColumn aem-GridColumn--default--12","h3_title_0":"aem-GridColumn aem-GridColumn--default--12","text_2":"aem-GridColumn aem-GridColumn--default--12","h3_title_1":"aem-GridColumn aem-GridColumn--default--12","h3_title_2":"aem-GridColumn aem-GridColumn--default--12","text_4":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","id":"disadvantages-of-reinforcement-learning",":type":"snowflake-site/components/container",":items":{"title_v2":{"id":"title-v2-2e30814eee","type":"heading2","lines":["Nachteile von Reinforcement Learning"],":type":"snowflake-site/components/title-v2"},"text_0":{"id":"text-be6abbb805","text":"\u003Cp\u003ETrotz seiner Flexibilität und Leistungsfähigkeit bringt Reinforcement Learning auch technische und praktische Herausforderungen mit sich, die in herkömmlichen ML-Workflows nicht auftreten. Trainingsinstabilität, falsch abgestimmte Belohnungen und hohe Rechenanforderungen können die Entwicklung erschweren, insbesondere wenn Systeme von der Simulation zur realen Bereitstellung übergehen.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_0":{"id":"title-v2-fb3d1e5f8d","type":"heading3","lines":["Hohe Daten- und Rechenkosten"],":type":"snowflake-site/components/title-v2"},"text_1":{"id":"text-251d34f978","text":"\u003Cp\u003EDas Training erfordert oft eine große Anzahl von Interaktionen sowie erhebliche Rechenressourcen, insbesondere in Deep-Reinforcement-Learning-Systemen.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_1":{"id":"title-v2-7974af5029","type":"heading3","lines":["Komplexes Belohnungsdesign"],":type":"snowflake-site/components/title-v2"},"text_2":{"id":"text-785f549c17","text":"\u003Cp\u003EDie Definition einer Belohnungsfunktion, die reale Ziele ohne unbeabsichtigte Folgen erfasst, gestaltet sich schwierig. Schon kleine Abstimmungsfehler können zu unerwünschtem Verhalten führen.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_2":{"id":"title-v2-9c8c4323f7","type":"heading3","lines":["Trainingsinstabilität"],":type":"snowflake-site/components/title-v2"},"text_3":{"id":"text-0de8b8af25","text":"\u003Cp\u003ERL-Algorithmen können instabil sein, insbesondere wenn sie mit neuronalen Netzen kombiniert werden. Eine Konvergenz ist hier nicht immer garantiert.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"},"h3_title_3":{"id":"title-v2-06dcdca97b","type":"heading3","lines":["Sicherheitsrisiken bei der Bereitstellung in der Praxis"],":type":"snowflake-site/components/title-v2"},"text_4":{"id":"text-469d6f1e82","text":"\u003Cp\u003EIn physischen oder besonders kritischen Einsatzbereichen kann exploratives Verhalten Risiken verursachen. Deshalb müssen Systeme wohlüberlegt eingeschränkt werden, um schädliche Ergebnisse zu verhindern.\u003C/p\u003E","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"}},":itemsOrder":["title_v2","text_0","h3_title_0","text_1","h3_title_1","text_2","h3_title_2","text_3","h3_title_3","text_4"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-extra-small"},"section_7":{"layout":"RESPONSIVE_GRID","columnCount":12,"columnClassNames":{"text_0":"aem-GridColumn aem-GridColumn--default--12","title_v2":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","id":"reinforcement-learning-in-the-ai-data-cloud",":type":"snowflake-site/components/container",":items":{"title_v2":{"id":"title-v2-094e568948","type":"heading2","lines":["Reinforcement Learning in der AI Data Cloud"],":type":"snowflake-site/components/title-v2"},"text_0":{"id":"text-53c70b8a45","text":"\u003Cp\u003ERL-Systeme erfordern skalierbare Rechenressourcen, kontrollierten Datenzugriff und reproduzierbare Workflows für Experimente. Die&nbsp;\u003Ca href=\"https://www.snowflake.com/de/\"\u003ESnowflake AI&nbsp;Data&nbsp;Cloud\u003C/a\u003E vereint Data&nbsp;Engineering, Analytics und KI-Entwicklung in einer einzigen Umgebung. Mit \u003Ca href=\"https://www.snowflake.com/de/product/features/end-to-end-ml-workflows/\"\u003ESnowflake&nbsp;ML\u003C/a\u003E und \u003Ca href=\"https://www.snowflake.com/de/product/features/cortex/\"\u003ESnowflake Cortex&nbsp;AI\u003C/a\u003E können Unternehmen auf hochwertige Daten zugreifen, ML-Modelle entwickeln und optimieren und KI-Workloads auf sichere und skalierbare Weise operationalisieren.\u003C/p\u003E\r\n\u003Cp\u003EWährend Reinforcement&nbsp;Learning zunehmend KI in Unternehmen prägt&nbsp;– einschließlich GenAI-Systemen&nbsp;–, ist eine einheitliche Daten- und KI-Grundlage entscheidend, um Experimente in einen dauerhaften unternehmerischen Mehrwert zu verwandeln.\u003C/p\u003E\r\n","richText":true,":type":"snowflake-site/components/text","appliedCssClassNames":"text-color-text-05"}},":itemsOrder":["title_v2","text_0"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-extra-small"},"section_8":{"layout":"RESPONSIVE_GRID","columnCount":12,"columnClassNames":{"title_v2":"aem-GridColumn aem-GridColumn--default--12","simple_snowflake_acc":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","id":"reinforcement-learning-faqs",":type":"snowflake-site/components/container",":items":{"title_v2":{"id":"title-v2-ec10bc9e69","type":"heading2","lines":["Häufig gestellte Fragen zum Reinforcement Learning"],":type":"snowflake-site/components/title-v2"},"simple_snowflake_acc":{"id":"simple-snowflake-accordion-8ba8025b10","showDivider":false,"accordionItemsList":[{"title":"Welche Algorithmen gibt es im Reinforcement Learning?","richText":"\u003Cp\u003EGängige RL-Algorithmen umfassen Q-Lernen, Deep Q-Networks, Policy-Gradient-Methoden sowie Actor-Critic-Ansätze wie Proximal Policy Optimization (PPO) und Soft Actor-Critic (SAC).\u003C/p\u003E"},{"title":"Nutzt ChatGPT Reinforcement Learning?","richText":"\u003Cp\u003ELarge Language Models werden in der Regel mit selbstüberwachtem Lernen vortrainiert: Hierbei wird das Modell mithilfe großer Textkorpora darin trainiert, das nächste Token in einer Abfolge vorherzusagen. Anschließend wird es mit Reinforcement Learning from Human Feedback (RLHF) optimiert, um die Ausgaben auf menschliche Präferenzen abzustimmen.\u003C/p\u003E"},{"title":"Ist Reinforcement Learning KI oder maschinelles Lernen?","richText":"\u003Cp\u003EReinforcement Learning ist ein Teilgebiet des maschinellen Lernens, das wiederum ein Zweig der künstlichen Intelligenz ist.\u003C/p\u003E"},{"title":"Was ist der Unterschied zwischen Reinforcement Learning und überwachtem Lernen?","richText":"\u003Cp\u003EÜberwachtes Lernen trainiert Modelle mit gekennzeichneten Daten. Reinforcement Learning trainiert Agenten über den Trial-and-Error-Ansatz (Versuch und Irrtum) und nutzt Belohnungen, um das Verhalten langfristig zu steuern.\u003C/p\u003E"}],":type":"snowflake-site/components/simple-snowflake-accordion","appliedCssClassNames":"snowflake-responsive-component-bottom-padding-small"}},":itemsOrder":["title_v2","simple_snowflake_acc"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-extra-small"},"section_9":{"layout":"RESPONSIVE_GRID","columnCount":12,"columnClassNames":{"flexible_column_cont":"aem-GridColumn aem-GridColumn--default--12","title_v2":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","id":"resources",":type":"snowflake-site/components/container",":items":{"title_v2":{"id":"title-v2-addb149aa0","type":"heading2","lines":["Ressourcen zu Reinforcement Learning"],":type":"snowflake-site/components/title-v2"},"flexible_column_cont":{"id":"flexible-column-container-a1c4b25fb1","type":"2-column-even","alignColumns":"top","containerMaxWidth":"extra-large","topPadding":"extra-small","bottomPadding":"none","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"backgroundImageOption":"none","flexible_column_content_container_1":{"layout":"SIMPLE","id":"container-97577203cd",":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container",":items":{"content_chip_0":{"id":"content-chip-f013a76ea0","tagText":"WEBINAR","tagColor":"#29B5E8","cta":{"id":"cta","showOutboundIcon":false,"buttonLink":{"valid":true,"url":"https://youtu.be/Eh33vfAP30U"},"linkTargetContentType":"GENERIC",":type":"snowflake-site/components/button","linkType":"SNOWFLAKE_EXTERNAL","text":"On-Demand ansehen"},"headline":{"id":"title-v2-90dd4e5f52","type":"heading5","lines":["Introduction to Reinforcement Learning"],":type":"snowflake-site/components/title-v2"},":type":"snowflake-site/components/content-chip"}},":itemsOrder":["content_chip_0"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-medium"},"flexible_column_content_container_2":{"layout":"SIMPLE","id":"container-267e720674",":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container",":items":{"content_chip_0":{"id":"content-chip-b54ecc2117","tagText":"LEITFADEN","tagColor":"#C6EDF1","cta":{"id":"cta","showOutboundIcon":false,"buttonLink":{"valid":true,"url":"https://www.snowflake.com/resource/5-ways-ai-and-machine-learning-accelerate-b2b-marketing-roi/"},"linkTargetContentType":"GENERIC",":type":"snowflake-site/components/button","linkType":"SNOWFLAKE_EXTERNAL","text":"Leitfaden lesen"},"headline":{"id":"title-v2-c78f2b45a0","type":"heading5","lines":["5 Ways AI and Machine Learning Accelerate B2B Marketing ROI"],":type":"snowflake-site/components/title-v2"},":type":"snowflake-site/components/content-chip"}},":itemsOrder":["content_chip_0"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-medium"},":type":"snowflake-site/components/flexible-column-container","isBlogPage":false,"isActiveTOC":false}},":itemsOrder":["title_v2","flexible_column_cont"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-extra-small"}},":itemsOrder":["section_0","section_1","section_2","section_3","section_4","section_5","section_6","section_7","section_8","section_9"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-large"},":type":"snowflake-site/components/flexible-column-container","isBlogPage":false,"isActiveTOC":false}},":itemsOrder":["flexible_column_cont"],"appliedCssClassNames":"snowflake-container snowflake-responsive-container-inner-padding-small"}},":itemsOrder":["container"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-small"},"container":{"layout":"RESPONSIVE_GRID","columnCount":12,"columnClassNames":{"container":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","id":"container-23af1b7bbc",":type":"snowflake-site/components/container",":items":{"container":{"layout":"RESPONSIVE_GRID","columnCount":12,"columnClassNames":{"related_content":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","id":"container-dc513f6842",":type":"snowflake-site/components/container",":items":{"related_content":{"id":"related-content-1a6321fde1","relatedContent":[],":type":"snowflake-site/components/blog/related-content","isBlogPage":false}},":itemsOrder":["related_content"],"appliedCssClassNames":"snowflake-container snowflake-responsive-container-inner-padding-small"}},":itemsOrder":["container"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-small"},"container_411970921_":{"additionalClasses":"section__prefooter-25","layout":"RESPONSIVE_GRID","columnCount":12,"columnClassNames":{"container":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","id":"container-db7edfea45",":type":"snowflake-site/components/container",":items":{"container":{"layout":"RESPONSIVE_GRID","columnCount":12,"columnClassNames":{"flexible_column_cont":"aem-GridColumn aem-GridColumn--default--12"},"gridClassNames":"aem-Grid aem-Grid--12 aem-Grid--default--12","id":"container-47c0885da2",":type":"snowflake-site/components/container",":items":{"flexible_column_cont":{"id":"flexible-column-container-7fe7ba708d","type":"1-column","alignColumns":"top","containerMaxWidth":"extra-large","topPadding":"none","bottomPadding":"none","spaceBetween":"small","reverseOnMobile":false,"carouselOnMobile":false,"propertiesCSSClasses":"front-container","backgroundImageOption":"none","flexible_column_content_container_1":{"layout":"SIMPLE","id":"container-932756803b",":type":"snowflake-site/components/flexible-column-container/flexible-column-content-container",":items":{"experiencefragment":{"id":"experiencefragment-9b3bb11ffe","localizedFragmentVariationPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/promos/pre-footer-promos/master/jcr:content","configured":true,":type":"snowflake-site/components/experiencefragment","xfModelPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/promos/pre-footer-promos/master.xfmodel.json?callerPage=/content/snowflake-site/global/de/artificial-intelligence/machine-learning/reinforcement-learning"}},":itemsOrder":["experiencefragment"]},":type":"snowflake-site/components/flexible-column-container","isBlogPage":false,"isActiveTOC":false}},":itemsOrder":["flexible_column_cont"],"appliedCssClassNames":"snowflake-container snowflake-responsive-component-bottom-padding-extra-small snowflake-responsive-container-inner-padding-small"}},":itemsOrder":["container"],"appliedCssClassNames":"snowflake-responsive-container-inner-padding-small"}},":itemsOrder":["hero_system_copy","container_copy","container","container_411970921_"],":type":"wcm/foundation/components/responsivegrid"},"modal_container":{"layout":"SIMPLE","id":"container-fbcb8a8ac0",":type":"snowflake-site/components/modal/modal-container",":items":{},":itemsOrder":[]},"experiencefragment-footer":{"id":"experiencefragment-42623192cd","localizedFragmentVariationPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/footer/master/jcr:content","configured":true,":type":"snowflake-site/components/experiencefragment","xfModelPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/footer/master.xfmodel.json?callerPage=/content/snowflake-site/global/de/artificial-intelligence/machine-learning/reinforcement-learning"},"experiencefragment":{"id":"experiencefragment-2b33fdd22a","localizedFragmentVariationPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/footer-legal-disclaimers/master/jcr:content","configured":true,":type":"snowflake-site/components/experiencefragment","xfModelPath":"/content/experience-fragments/snowflake-site/language-masters/de/site/footer-legal-disclaimers/master.xfmodel.json?callerPage=/content/snowflake-site/global/de/artificial-intelligence/machine-learning/reinforcement-learning"}},":itemsOrder":["experiencefragment-banner","experiencefragment-header","markup_editor","responsivegrid","modal_container","experiencefragment-footer","experiencefragment"],":type":"wcm/foundation/components/responsivegrid"}},":itemsOrder":["root"],":hierarchyType":"page",":path":"/content/snowflake-site/global/de/artificial-intelligence/machine-learning/reinforcement-learning","isPasswordProtected":false,"analyticsContentTags":["snowflake-site:taxonomy/content-type/fundamentals","snowflake-site:taxonomy/product/ai"],"analyticsEnabled":true,"coveoConfig":{"pipeline":"snowflake.com","searchHub":"snowflake.com","organizationId":"snowflakecomputingproduction8neljofn","apiKey":"xx335921a6-2a0a-40f2-a167-e390b4766c3d"},"analyticsDebugMode":false,"analyticsData":{"excludeFromAnalytics":false,"subCategory":"","pageType":"homepage","templateName":"fundamentals-template","siteName":"snowflake","pageUrl":"/content/snowflake-site/global/de/artificial-intelligence/machine-learning/reinforcement-learning","language":"de","category":"general","pageName":"Was ist Reinforcement Learning? Ein umfassender Leitfaden","contentTags":["snowflake-site:taxonomy/content-type/fundamentals","snowflake-site:taxonomy/product/ai"]},"locale":"de"}
  