Een reputatiescore verliest zijn waarde als bijna iedereen dezelfde hoge beoordeling krijgt. De techniek blijft werken, maar de uitkomst maakt nauwelijks nog onderscheid.
Filippas, Horton en Golden onderzochten één online arbeidsmarkt. In ongeveer zes jaar steeg het aandeel werkers met een perfecte beoordeling van circa 33 naar circa 85 procent.¹ De gemiddelde beoordeling liep op zonder aanwijzing dat de kwaliteit van het werk even sterk verbeterde. Een verklaring is dat degene die een lage beoordeling geeft daar sociale gevolgen van kan ondervinden.
Bron: Filippas, Horton en Golden (2022), Reputation Inflation, Marketing Science 41(4). De publicatie noemt alleen het begin- en eindpunt. Daarom toont deze figuur geen tussenliggende jaren.
Waarom beoordelingen steeds hoger worden
De volgorde speelt daarbij een belangrijke rol. Op veel platforms dient de ene partij eerst een beoordeling in. De andere partij ziet die beoordeling en reageert daarna. Het tweede oordeel is dan niet meer volledig onafhankelijk.
Fradkin, Grewal en Holtz onderzochten dit op Airbnb door beide beoordelingen verborgen te houden totdat beide partijen hadden gereageerd.² Vergelding en wederkerigheid namen af en de gemiddelde beoordelingen daalden. De auteurs vonden echter geen meetbaar effect op wie uiteindelijk werd geboekt. Het ontwerp maakte de beoordelingen onafhankelijker, maar verbeterde de marktuitkomst niet aantoonbaar.
Bron: Fradkin, Grewal en Holtz (2021), Journal of Marketing Research.
Daar bovenop komt fraude. Luca en Zervas brachten stelselmatige reviewfraude op Yelp in kaart en lieten zien dat die zich ophoopt waar de concurrentiedruk het hoogst is.³ Inflatie en fraude zijn verschillende problemen met dezelfde uitkomst: zodra bijna iedereen uitstekend is, scheidt de score niemand meer.
Eerder onderzoek naar online reputatiesystemen beschreef de basisfunctie als het leveren van genoeg informatie om vreemden met elkaar te laten handelen. De auteurs waarschuwden tegelijk voor manipulatie en de moeite om eerlijke feedback te krijgen.⁴ Experimenteel onderzoek van Bolton, Greiner en Ockenfels liet later zien dat ontwerpkeuzes vertrouwen en doelmatigheid kunnen verbeteren, maar ook dat reputatie-informatie het gedrag van deelnemers verandert en niet alleen registreert.⁵
Als vijf van de zes gebruikers een topscore krijgen, maakt de score nauwelijks nog onderscheid. Dat probleem ontstaat niet door een technische storing, maar door de manier waarop beoordelingen worden verzameld.
De onderdelen van Signal Score
De Signal Score bestaat uit zeven onderdelen. Elk onderdeel krijgt een score van 0 tot 100 en telt met een eigen gewicht mee. De gewichten staan ook op de Signal-pagina.
| Onderdeel | Gewicht | Wat het telt |
|---|---|---|
| Projecten | 25% | Projecten waarvan je eigenaar bent, extra voor gelanceerde |
| Beoordelingen | 20% | Gemiddelde score die anderen je gaven |
| Samenwerking | 15% | Aandeel van je samenwerkingen dat is afgerond |
| Profiel | 10% | Volledigheid: kop, bio, locatie, focus, vaardigheden |
| Betrokkenheid | 10% | Je huidige activiteitenreeks |
| Verwijzingen | 10% | Mensen die je aanbracht en die actief werden |
| Reageren | 10% | Aandeel van je werkomgevingen waarin je ook echt schreef |
Beperkingen in de huidige formule
Ook de huidige Signal Score gebruikt maatstaven die niet rechtstreeks iets over de kwaliteit van samenwerking zeggen.
Het zwaarste onderdeel, met een gewicht van 25 procent, telt projecten die iemand zelf heeft aangemaakt. Dat aantal toont activiteit, maar niet of anderen het project waardevol vinden.
Betrokkenheid telt voor 10 procent mee en is gebaseerd op een activiteitenreeks. Vijfentwintig opeenvolgende dagen leveren de maximale score op. Dat meet aanwezigheid, geen kwaliteit.
Beide staan er om een verdedigbare reden, namelijk dat het de enige invoer is die er is voordat er is samengewerkt. Die reden verloopt op het moment dat er echte samenwerkingsdata bestaat, en dan horen de gewichten mee te bewegen.
Waar een Signal Score vandaag werkelijk uit bestaat
Forenta bevindt zich in publieke beta. De huidige productstatus bepaalt daarom sterk welke gegevens al beschikbaar zijn.
Er is nog geen beoordelingsscherm, waardoor het onderdeel beoordelingen nog geen gegevens bevat. Ook registreert het product nog niet dat een samenwerking is afgerond. Daardoor leveren beoordelingen en samenwerking samen nog geen punten op, ongeacht de ervaring van de gebruiker.
Een Signal Score bestaat vandaag dus vooral uit profielvolledigheid, een activiteitenreeks en verwijzingen. Onderdelen waarvoor nog geen gegevens beschikbaar zijn, moeten als niet vastgesteld worden gelezen. Zo'n score is niet alleen laag. De gegevensbasis is ook onvolledig.
De invloed van betaalde plannen op de score
De invloed van een betaald plan is rechtstreeks in het product te controleren.
Bij een plan wordt een vermenigvuldiger opgeslagen, 1,5 voor Pro en 2,0 voor Max. Die vermenigvuldiger wordt niet toegepast op de Signal Score. Het gewogen totaal wordt uitsluitend uit de zeven onderdelen berekend.
Waar een plan wel effect heeft, is de aparte matchscore die Forge gebruikt bij het voorstellen van mensen, en tijdens de beta kan sowieso niemand Pro of Max kopen. Beide zijn aangekondigd voor na de beta, niet vandaag te koop.
Wat dit niet behandelt
Dit beschrijft het ontwerp en de huidige stand, geen bewezen uitkomst. Nergens blijkt hier dat Signal Score goede samenwerking voorspelt, want er is nog te weinig afgeronde samenwerking om het tegen te toetsen. De gewichten zijn een beginstand, en een beginstand die is gekozen voordat de data bestaat, is een hypothese.
De betwiste gevallen zijn ook onopgelost. Wat een samenwerking die in onderling overleg eindigt met de score hoort te doen, of wat er gebeurt als twee mensen het oneens zijn over of iets af was, staat nog nergens in de code.
De volledige uitsplitsing per onderdeel staat op de Signal-pagina. Wil je met de gewichten in discussie, dan is dat de plek om te kijken, en die discussie is terecht.
Verhoogt betalen voor Pro of Max mijn Signal Score?
Nee. De planvermenigvuldiger wordt naast de score opgeslagen en komt nooit in de berekening. Hij raakt een aparte matchscore die Forge gebruikt bij het voorstellen van mensen, en betaalde plannen zijn tijdens de publieke beta hoe dan ook niet te koop.
Waarom is mijn score laag terwijl ik elders echte ervaring heb?
Omdat Forenta geen externe ervaring of diploma's importeert. Dat voorkomt dat gebruikers de score eenvoudig met zelf opgegeven gegevens verhogen. Het gevolg is wel dat ervaren mensen binnen Forenta met dezelfde beginscore starten als anderen.
Welke onderdelen van de score werken nu?
Profielvolledigheid, activiteitenreeks, verwijzingen en projecten. Beoordelingen en afgeronde samenwerking worden nog nergens in het product geproduceerd, dus die twee onderdelen staan voor iedereen op nul.
Bronnen
- 1.Filippas, A., Horton, J. J., & Golden, J. M. (2022). Reputation Inflation. Marketing Science, 41(4), 733–745.
- 2.Fradkin, A., Grewal, E., & Holtz, D. (2021). Reciprocity and Unveiling in Two-Sided Reputation Systems: Evidence from an Experiment on Airbnb. Marketing Science, 40(6), 1013–1029.
- 3.Luca, M., & Zervas, G. (2016). Fake it till you make it: Reputation, competition, and Yelp review fraud. Management Science, 62(12), 3412–3427.
- 4.Resnick, P., Kuwabara, K., Zeckhauser, R., & Friedman, E. (2000). Reputation systems. Communications of the ACM, 43(12), 45-48.
- 5.Bolton, G., Greiner, B., & Ockenfels, A. (2013). Engineering Trust: Reciprocity in the Production of Reputation Information. Management Science, 59(2), 265-285.