Een ML-experiment inschatten
Hoe u een ML-experiment kunt inschatten: het is onderzoek in combinatie met techniek. Het model is eenvoudig, het werk zit hem in de gegevens. Hoe u de omvang van een budget bepaalt, niet een prognose.
Het model is het makkelijke deel. De gegevens vormen het echte werk.
Een ML-experiment is onderzoek waarin ook technische aspecten een rol spelen. De modelarchitectuur is doorgaans een kant-en-klare keuze en het trainen verloopt volgens een bekend patroon. Het werk vindt plaats in de vroege fasen: het verkrijgen van schone trainingsgegevens, het vaststellen van de evaluatiemaatstaf waaraan het team zich strikt zal houden, en het opzetten van de pijplijn die het model van het notebook naar de productie brengt. De eerste 80% van het experiment bestaat uit gegevensverwerking; de laatste 20% betreft het model.
Het maken van een schatting voor een ML-experiment op basis van de feature deck is dezelfde valkuil als het maken van een schatting voor een onderzoekspiek: u weet niet wat u zult aantreffen. De raming moet een budget voor het experiment zijn, geen voorspelling van het resultaat. Als het resultaat luidt: „het model werkt niet”, dan is dat nog steeds een succesvol experiment dat het budget heeft opgebruikt; het team kan niet doen alsof die uitkomst betekent dat de uitgangspunten onjuist zijn.
Wat er in de kamer wordt gezegd
ML-ingenieur: „Het trainen duurt één dag. Het model is standaard.”
Inleiding: “Waar komen de trainingsgegevens vandaan?”
Gegevens: “We moeten eerst ongeveer 5.000 voorbeelden labelen.”
PM: „Aan de hand van welke maatstaf kunnen wij vaststellen of het experiment geslaagd is?”
SRE: „Als het werkt, hoe ziet de implementatie er dan uit? Wat is de latentie bij het trekken van conclusies? En wat zijn de kosten?”
Vragen die het waard zijn om te stellen voordat u gaat stemmen
- Zijn de trainingsgegevens al klaar, of hoort het labelen hier ook bij?
- Wat is de evaluatiemaatstaf en wat is de referentiewaarde die moet worden overtroffen?
- Een experiment dat zich uitsluitend tot de notebook beperkt, of een end-to-end-experiment inclusief een serving-traject?
- Wat is de tijdsperiode en wat is het eindresultaat daarvan?
- Als het model werkt, hoe verloopt dan het traject naar productie, en valt dat binnen de scope?
- Kosten van training en inferentie: beschikt het team over het benodigde budget?
Indien zowel labeling als een verwerkingstraject een rol spelen, vormen deze geen enkel geheel: split de gegevensverwerking, het experiment en de implementatie in de productieomgeving, en bepaal de omvang van elk onderdeel op basis van wat het daadwerkelijk is.
Stel een budget vast voor het experiment, maar maak geen voorspellingen over het resultaat. Een model dat mislukt, is nog steeds een resultaat waarvoor betaald is.
Net als bij het inschatten van een onderzoeksspits en het inschatten van een prototype staat kennis voorop als eindresultaat. Bekijk de andere praktijkvoorbeelden van schattingen, of start een gratis Planning Poker-sessie zodra het experiment zijn resultaten heeft opgeleverd.